小分子化药质量文档的工作流编排

小分子化药的质量文档数据主要来源于研发、生产、质检等环节的各类报告与记录。这些文档包括但不限于批生产记录、检验报告(如高效液相色谱HPLC、质谱MS数据)、

这个品类的数据长什么样

小分子化药的质量文档数据主要来源于研发、生产、质检等环节的各类报告与记录。这些文档包括但不限于批生产记录、检验报告(如高效液相色谱 HPLC、质谱 MS 数据)、稳定性研究报告、偏差处理记录、变更控制文件、供应商审计报告等。数据更新频率因文档类型而异,生产批记录通常随批次产生,检验报告在分析完成后即生成,而稳定性研究报告则有固定的时间点更新周期,例如 3 个月、6 个月、12 个月。文档结构多为半结构化或非结构化,PDF 扫描件、Word 文档、Excel 表格是常见形式。字段与单位具有高度专业性,例如含量(%)、纯度(%)、杂质限度(ppm)、pH 值、熔点(℃)、旋光度([α]D)、吸光度(A)等,且常伴随复杂的图谱和表格数据。

这些特征在「工作流编编排」这一环带来什么约束

小分子化药质量文档的半结构化与非结构化特性,对工作流中的文档解析与信息提取提出了挑战。大量图谱和复杂表格的存在,要求工作流具备高级的 OCR 和表格识别能力,以准确提取关键数据点,例如 HPLC 峰面积、MS 碎片离子信息。高频次更新的生产批记录和检验报告,意味着工作流需要支持自动化触发和增量更新,确保知识库的时效性。专业化的字段与单位,以及严格的合规性要求,使得信息提取的准确性至关重要,任何微小的偏差都可能影响最终的质量判断。工作流在处理这些数据时,需要设计多阶段的校验机制,甚至引入人工复核节点,以应对数据提取的复杂性和潜在错误,保障最终回答的可靠性。

配置怎么定

配置项建议取法这样取的依据
分段长度800–1200 字符适应质量文档中包含的较长专业描述与实验方法,确保上下文完整性。
分段重叠长度100 字符减少因分段导致的关键信息割裂,尤其在描述实验步骤或结果时。
召回条数前 8–12 条小分子化药的质量问题往往涉及多个文档交叉验证,需要更广的召回范围。
相似度阈值0.78–0.85确保召回内容的精准性,避免因术语相似但实际含义不同导致误判。
重排返回条数前 5 条在高召回条数基础上,通过重排聚焦最相关的文档片段,提高最终回答效率。
PARSE_FILE_TIMEOUT_SECONDS600 秒应对大型 PDF 扫描件或包含复杂图表的文档解析,防止超时中断。

容易做错的三处

  • 在知识库助手中,调用工作流 API 时返回空值,这通常是由于工作流内部嵌套的知识库助手在 v4.8.10 及以上版本中,其 api_key 或 app_id 未正确配置或权限不足导致。
  • 工作流中无法将不同分支的节点转接到已有的表单填写节点,表现为界面上无法拖动连接线,原因在于 FastGPT 的工作流设计中,某些节点类型(如表单节点)有严格的输入来源限制,不允许随意接驳。
  • 在变量引用时出现 quote type error 报错,现象为工作流执行中断并显示错误信息,这通常是由于传递给工作流或知识库的变量格式与预期不符,例如期望 int 类型却接收到 string 类型,或 JSON 结构不匹配。

怎么确认配好了

  • 上传一份包含复杂图谱和表格的检验报告 PDF 文件,观察其解析结果,核对关键数据点(如主成分含量、杂质峰面积)是否准确提取。
  • 构建一个包含多个质量文档的工作流,模拟常见的质量审核场景,例如查询某批次产品的稳定性数据,检查工作流是否能正确检索并组织信息。
  • 针对一份有明确偏差处理流程的文档,设计问答,测试模型对流程步骤的理解和关键决策点的识别能力,确保回答符合合规要求。
  • 使用 GET /api/v1/app/workflow/run 接口调用工作流,并比对 API 返回结果与通过界面调试结果的一致性,核实 maxContext、召回条数 等参数是否按预期生效。

问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。