这个品类的数据长什么样
临床前安全评价(安评)制度的数据主要来源于国家药品监督管理局(NMPA)、国际人用药品注册技术协调会(ICH)等官方机构发布的法规、指南、技术要求,以及企业内部制定的标准操作规程(SOP)、内部管理规定、风险评估报告等。这些文档多以 PDF、Word 格式存在,内容结构严谨,包含大量专业术语、图表和参考文献。更新频率相对较低,通常随政策法规修订或技术标准更新而发布,可能每隔数月至数年才会有大范围变动。文档中涉及的字段和单位高度标准化,例如毒性剂量(mg/kg)、给药途径、观察指标(如脏器系数)、统计学显著性(p值)等,对精确性和一致性要求极高。
这些特征在「工作流编排」这一环带来什么约束
安评制度文档的严谨性与低更新频率,决定了在工作流编排中对知识库召回准确性的高要求,需要精细化地配置文本分段和召回策略。文档中的专业术语和标准化字段,要求工作流中的语义理解模块能够精准识别,避免歧义。例如,剂量单位的微小差异可能导致评估结果的重大偏差。低更新频率意味着知识库的重建和索引操作不必过于频繁,但每次更新都需确保全面性。文档结构复杂,包含大量图表和交叉引用,这要求文档解析器具备强大的结构化信息提取能力,以便工作流后续能准确引用图表数据或关联条款,提高问答的可靠性。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | 确保法规条款的完整性,减少语义割裂,同时避免单段过长影响召回效率。 |
召回条数 | 5 条 | 综合考虑临床前安评制度的上下文关联性,多召回确保信息全面,控制在合理范围减少干扰。 |
相似度阈值 | 0.75 | 临床前安评问答对准确性要求高,高阈值过滤掉不相关或模糊的召回结果。 |
重排返回条数 | 3 条 | 经过重排模型优化,聚焦最相关的三条,提高最终回答的精确度。 |
maxContext | 4000 token | 保障复杂法规条款的完整上下文能够被大模型理解,避免关键信息丢失。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 临床前安评文档通常较大且结构复杂,预留充足解析时间防止超时失败。 |
容易做错的三处
- 工作流对外接口调用时,全局变量未正确传递导致逻辑中断或返回空值;原因在于外部平台调用接口时,未按照预设的参数格式或名称传递全局变量。
- AI从数据库查询后,回答中未引用查询结果,导致答案缺乏依据;原因在于工作流中AI节点未正确配置引用召回内容,或召回内容与问题相关性不足。
- 判断器无论如何提问都判断不为空,导致流程无法按预期分支;原因在于判断器规则设置过于宽泛,未能精确匹配到需要判断的特定条件或字段。
怎么确认配好了
- 针对典型的临床前安评制度问题,测试工作流能否准确召回相关法规条款,并检查召回内容的完整性。
- 模拟外部系统调用,验证全局变量能否正确传入工作流,并观察流程执行结果是否符合预期。
- 提交包含敏感词汇或边界条件的查询,检查判断器能否准确分类并触发相应分支,确保无误判。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。