这个品类的数据长什么样
供应商审计资料主要来源于供应商提供的质量体系文件、生产工艺记录、检验报告、变更控制文件以及现场审计报告等。这些资料更新频率不一,例如年度审计报告通常每年更新,而偏差处理和CAPA(纠正与预防措施)文件可能根据事件发生实时更新。文档结构多样,包含 Word 文档、PDF 扫描件、Excel 表格以及图片格式的流程图等。字段与单位具有行业特异性,例如批次号、生产日期、有效期、检测限、含量百分比(%)、微生物限度单位(CFU/g 或 CFU/mL)、偏差等级(重大、主要、次要)等,这些字段的准确性和一致性对注册申报至关重要。部分文档可能包含手写签名和批注。
这些特征在「工作流编排」这一环带来什么约束
供应商审计资料的异构性对工作流编排提出了挑战。多源数据要求工作流支持多格式文件输入,并能通过光学字符识别(OCR)处理扫描件,将非结构化数据转化为可解析文本。更新频率的不一致性意味着工作流需要具备版本管理能力,确保始终处理最新或指定版本的资料,同时能追溯历史变更。文档中特有的生物医药字段和单位,要求模型具备领域知识,能够准确识别并提取关键信息,避免因误解专业术语导致的数据偏差。例如,对“批次放行”或“偏差调查”等特定流程的理解,需要模型在处理相关文本时能正确识别其上下文语义。此外,手写签名和批注的存在,要求工作流在提取信息时能区分正式内容与批注,并能够对批注内容进行归纳或标记,以供人工复核。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
maxContext | 8000 tokens | 审计报告和质量体系文件篇幅较长,确保模型能一次性处理完整上下文,减少信息碎片化。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 大型 PDF 扫描件或复杂 Excel 文件解析耗时较长,避免因超时导致解析失败。 |
分段长度 | 800 字符 | 兼顾语义完整性和模型处理效率,确保每个文本段落包含足够信息进行理解和摘要。 |
相似度阈值 | 0.78 | 提高召回精度,确保在海量文件中准确匹配到供应商资质、生产批次等关键信息。 |
重排返回条数 | 前 5 条 | 注册申报对信息准确性要求高,聚焦最相关的少量结果,减少人工筛选负担。 |
模型节点思考 | 启用 | 审计资料复杂,启用模型思考能力,有助于处理复杂逻辑判断和多文档交叉验证。 |
容易做错的三处
- 工作流节点返回
500 Internal Server Error,日志显示model request failed:通常是由于模型输入上下文长度超出限制,或输入格式与模型预期不符,导致模型处理异常。 - 批量执行节点结果输出为空或不完整:这可能是因为循环节点内部的子任务未正确将结果传递到循环外部的全局变量,导致最终汇总时数据丢失。
- 提取的批次号或有效期字段为空:文档解析或信息抽取模型未正确识别文档中特定格式的字段,或 OCR 识别错误导致关键信息丢失。
怎么确认配好了
- 运行包含多个供应商审计报告的工作流,检查每个报告的关键信息(如供应商名称、审计日期、主要发现)是否被准确提取并结构化。
- 随机抽取一批带有复杂表格和图表的 PDF 审计文件,验证 OCR 识别后,工作流能否正确解析并抽取表格数据。
- 针对不同版本的同一供应商文件,验证工作流能否识别最新版本,并能追溯历史版本差异。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。