这个品类的数据长什么样
siRNA 核酸药的制度文档主要来源于药监部门(如 FDA、NMPA)发布的指导原则、技术审评要求以及企业内部制定的标准操作规程(SOP)、质量管理体系文件等。这些文档更新频率较低,通常以季度或年度为周期进行修订。文档结构以 PDF 或 Word 格式为主,包含大量非结构化文本、表格、图表和流程图。字段和单位方面,涉及具体实验参数时可能出现微摩尔 (µM)、纳摩尔 (nM)、百分比 (%) 等生物化学单位;涉及行政审批流程时,则以日期、编号、责任人等常规字段为主。文档之间存在复杂的引用关系,例如一份 SOP 可能引用多份指导原则,或多份 SOP 共同构成一个质量管理体系的子集。
这些特征在「工作流编排」这一环带来什么约束
siRNA 核酸药制度文档的低更新频率意味着知识库构建时不必频繁进行全量更新,可以更多依赖增量更新策略。大量的非结构化文本和图表要求工作流在文档解析阶段需支持多种文件格式,并具备图像文字识别 (OCR) 能力。文档间的引用关系要求工作流具备多文档关联查询能力,避免单一文档检索的局限性。生物化学单位和行政字段的混杂,对实体识别和信息抽取的准确性提出较高要求,需要针对特定术语进行优化。此外,审批流程中的多层用户选择场景,如根据问题分支进行连续提问,使得工作流编排需要支持复杂的条件判断和多轮对话管理,以确保用户能获取到符合其特定业务场景的制度信息。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | siRNA 文档通常段落较长,包含复杂描述,保持较长分段可保留更多上下文。 |
召回条数 | 前 5 条 | 制度问答需要较高的准确性,适量增加召回条数可提高相关性覆盖。 |
相似度阈值 | 0.78–0.85 | 制度文本语义相似度要求较高,设定较高阈值可筛选出更精准的结果。 |
重排返回条数 | 3 条 | 经过重排模型筛选,返回少量高质量结果,减轻模型处理负担。 |
最大上下文窗口 | 4000 token | 确保能够容纳多条召回结果及多轮对话历史,保持对话连贯性。 |
文档解析超时时间 | 600 秒 | 包含大量图表和复杂表格的 PDF 文档解析耗时较长,预留充足时间。 |
容易做错的三处
- 现象:工作流在多轮对话中突然中断,或给出与之前对话不一致的答案。 原因:
最大上下文窗口设置过小,导致模型丢失早期对话历史,无法维持对话连贯性。 - 现象:用户提问涉及具体实验参数(如浓度单位),AI 回答时未引用相关数据,或引用了不相关内容。 原因:文档解析阶段对包含生物化学单位的表格数据提取不完整,或实体识别模型未针对特定术语进行训练。
- 现象:发布接口后,外部系统调用时发现某些全局变量未按预期传递。 原因:工作流的全局变量配置未正确映射到对外接口的输入参数,或外部调用时参数名称不匹配。
怎么确认配好了
- 选择一份包含复杂表格和图表的 siRNA 制度 PDF 文档,上传并检查解析后的文本内容,确保表格和图表中的文字信息被准确提取。
- 设计包含多层条件判断和分支的测试问题序列,模拟用户真实提问路径,验证工作流能否正确引导对话并给出恰当回复。
- 针对涉及特定生物化学单位和行政字段的查询,检查 AI 回答中是否准确引用了文档中的具体数值和字段信息,并对比原始文档核实。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。