这个品类的数据长什么样
小分子化药的质量文档数据主要来源于研发、生产、质检等环节的各类报告与记录。这些文档包括但不限于批生产记录、检验报告(如高效液相色谱 HPLC、质谱 MS 数据)、稳定性研究报告、偏差处理记录、变更控制文件、供应商审计报告等。数据更新频率因文档类型而异,生产批记录通常随批次产生,检验报告在分析完成后即生成,而稳定性研究报告则有固定的时间点更新周期,例如 3 个月、6 个月、12 个月。文档结构多为半结构化或非结构化,PDF 扫描件、Word 文档、Excel 表格是常见形式。字段与单位具有高度专业性,例如含量(%)、纯度(%)、杂质限度(ppm)、pH 值、熔点(℃)、旋光度([α]D)、吸光度(A)等,且常伴随复杂的图谱和表格数据。
这些特征在「工作流编编排」这一环带来什么约束
小分子化药质量文档的半结构化与非结构化特性,对工作流中的文档解析与信息提取提出了挑战。大量图谱和复杂表格的存在,要求工作流具备高级的 OCR 和表格识别能力,以准确提取关键数据点,例如 HPLC 峰面积、MS 碎片离子信息。高频次更新的生产批记录和检验报告,意味着工作流需要支持自动化触发和增量更新,确保知识库的时效性。专业化的字段与单位,以及严格的合规性要求,使得信息提取的准确性至关重要,任何微小的偏差都可能影响最终的质量判断。工作流在处理这些数据时,需要设计多阶段的校验机制,甚至引入人工复核节点,以应对数据提取的复杂性和潜在错误,保障最终回答的可靠性。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | 适应质量文档中包含的较长专业描述与实验方法,确保上下文完整性。 |
分段重叠长度 | 100 字符 | 减少因分段导致的关键信息割裂,尤其在描述实验步骤或结果时。 |
召回条数 | 前 8–12 条 | 小分子化药的质量问题往往涉及多个文档交叉验证,需要更广的召回范围。 |
相似度阈值 | 0.78–0.85 | 确保召回内容的精准性,避免因术语相似但实际含义不同导致误判。 |
重排返回条数 | 前 5 条 | 在高召回条数基础上,通过重排聚焦最相关的文档片段,提高最终回答效率。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 应对大型 PDF 扫描件或包含复杂图表的文档解析,防止超时中断。 |
容易做错的三处
- 在知识库助手中,调用工作流 API 时返回空值,这通常是由于工作流内部嵌套的知识库助手在
v4.8.10及以上版本中,其api_key或app_id未正确配置或权限不足导致。 - 工作流中无法将不同分支的节点转接到已有的表单填写节点,表现为界面上无法拖动连接线,原因在于 FastGPT 的工作流设计中,某些节点类型(如表单节点)有严格的输入来源限制,不允许随意接驳。
- 在变量引用时出现
quote type error报错,现象为工作流执行中断并显示错误信息,这通常是由于传递给工作流或知识库的变量格式与预期不符,例如期望int类型却接收到string类型,或 JSON 结构不匹配。
怎么确认配好了
- 上传一份包含复杂图谱和表格的检验报告 PDF 文件,观察其解析结果,核对关键数据点(如主成分含量、杂质峰面积)是否准确提取。
- 构建一个包含多个质量文档的工作流,模拟常见的质量审核场景,例如查询某批次产品的稳定性数据,检查工作流是否能正确检索并组织信息。
- 针对一份有明确偏差处理流程的文档,设计问答,测试模型对流程步骤的理解和关键决策点的识别能力,确保回答符合合规要求。
- 使用
GET /api/v1/app/workflow/run接口调用工作流,并比对 API 返回结果与通过界面调试结果的一致性,核实maxContext、召回条数等参数是否按预期生效。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。