这个品类的数据长什么样
供应商审计的质量文档主要包括审计报告、纠正预防措施(CAPA)记录、供应商资质证明、生产过程控制文件、质量协议等。数据来源通常是供应商提交、现场审计采集、实验室检测报告以及企业内部质量管理系统。更新节奏取决于审计周期和CAPA的关闭情况,通常是季度或年度更新,但CAPA相关文档可能在数周内有多次修订。文档结构复杂,包含大量非结构化文本、表格数据、图片及附件。字段方面,除了通用文档属性,还涉及供应商代码、审计日期、发现项编号、缺陷描述、风险等级、整改计划、完成日期等,单位可能包括日期、百分比、数量、批次号等,且经常出现行业特定缩写。
这些特征在「工作流编排」这一环带来什么约束
供应商审计文档的复杂性与非结构化特性,对工作流编排提出了特定要求。首先,文档来源多样且更新频率不一,要求工作流能够灵活触发,例如基于文件上传事件或定时扫描特定目录。其次,文档中包含大量关键字段和表格数据,传统的文本分段方式可能导致语义丢失,需要工作流在预处理环节集成表格解析与实体抽取能力,确保关键信息被有效识别和索引。再者,审计发现项的风险等级与整改计划通常是下游AI对话或决策的关键输入,这意味着工作流需要确保这些信息的准确提取,并能作为上下文变量传递。最后,文档中常出现行业特定术语和缩写,要求工作流中的语言模型或知识库能够有效处理,避免因术语理解偏差导致的结果不准确。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
UPLOAD_TRIGGER_PATH | /audits/suppliers/ | 审计文档通常按供应商和日期归档,指定特定目录监控新文件上传。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 审计报告可能包含大量内容和复杂表格,需要更长的解析时间。 |
CHUNK_SIZE | 800–1200 字符 | 平衡上下文完整性和检索效率,适应长文本和表格混合的文档结构。 |
OVERLAP_SIZE | 100 字符 | 确保分段间有足够重叠,提升跨段落语义连贯性,避免信息丢失。 |
EXTRACT_ENTITY_TYPES | 供应商代码, 审计日期, 风险等级 | 供应商审计的核心信息,便于后续AI问答和数据分析。 |
MAX_RETRIES | 3 次 | 面对网络波动或API瞬时故障,增加重试机制提升工作流鲁棒性。 |
容易做错的三处
- 工作流执行到一半中断,日志显示“API调用失败,错误码:500”。这通常是由于在流程中调用第三方API时,数据格式不符合API预期或认证信息过期。
- AI对话结果缺乏审计发现项的具体细节,即使文档中已包含。原因可能是文档解析阶段未能正确识别并抽取表格中的关键字段,导致这些信息未被有效索引或作为上下文传递。
- 流程开始时设置的全局变量在后续步骤中为空值。这可能发生在尝试在流程开始前通过外部请求获取变量,但请求失败或返回的数据结构与预期不符,导致无法正确赋值。
怎么确认配好了
- 上传一份典型的供应商审计报告,检查文件解析日志,确认
PARSE_FILE_STATUS显示为SUCCESS,且解析耗时在PARSE_FILE_TIMEOUT_SECONDS以内。 - 通过知识库检索功能,输入审计报告中的关键发现项描述或供应商名称,验证能否召回相关文档片段,并检查召回片段中是否包含
EXTRACT_ENTITY_TYPES中定义的字段值。 - 运行一个包含AI对话的工作流,模拟提问“某供应商的最新审计报告中,有哪些高风险发现项?”,观察AI的回答是否能准确引用审计日期、风险等级和具体整改措施,以此判断实体抽取和上下文传递是否生效。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。