这个品类的数据长什么样
供应商审计的质量文档主要包括审计报告、不符合项清单、纠正预防措施(CAPA)记录、供应商资质证明、现场照片及相关沟通记录。这些文档的来源通常是供应商提交的报告、审计团队的现场记录以及内部质量管理系统。文档的更新节奏不一,审计报告通常是周期性的(例如每年或每两年),而CAPA记录则根据不符合项的解决进度实时更新。文档结构上,审计报告多为结构化或半结构化,包含明确的章节标题和数据表格;不符合项清单则以列表形式呈现,字段包括不符合项描述、责任方、计划完成日期、实际完成日期等。字段的单位通常涉及日期、百分比(如缺陷率)、数量等,文本描述中可能包含大量专业术语和缩写。
这些特征在「模型接入与配置」这一环带来什么约束
供应商审计文档的半结构化特性决定了在模型接入时,需要兼顾结构化信息提取与非结构化文本理解的能力。审计报告中的表格数据提取是重点,这要求模型具备表格解析能力,确保字段与数值的正确关联。CAPA记录的更新频率较高,因此知识库的同步更新机制需要灵活配置,不能依赖于全量重建,增量更新是更优选择。文档中常见的专业术语和缩写,要求模型在嵌入和召回阶段具备较强的领域适应性,可能需要通过领域数据进行微调或增强。此外,大量日期和百分比等特定单位的存在,提示在信息抽取后进行数据格式校验的必要性,防止模型输出格式错误导致下游应用解析失败。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | 兼顾长文本语义完整性与短文本召回效率,避免审计报告中关键信息被截断。 |
重叠长度 | 100 字符 | 确保上下文衔接,处理审计报告中跨段落的逻辑关联。 |
相似度阈值 | 0.75 | 提高召回精度,减少无关文档干扰,适用于法规 Compliance 相关查询。 |
召回条数 | 前 5 条 | 兼顾模型处理能力与信息完整性,确保模型能获取足够上下文进行判断。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 处理大型审计报告或包含大量图片/表格的文档,避免解析超时。 |
maxContext | 8192 | 适应长文本输入模型,处理复杂审计问题时提供更丰富的上下文信息。 |
容易做错的三处
- 模型返回思考过程为空,或输出逻辑混乱。原因在于模型参数
temperature过高或top_p配置不当,导致模型生成答案时发散性过强,未能聚焦于审计文档的严谨性要求。 - 上传大型供应商审计报告后,文件解析失败或进度停滞。这是由于
UPLOAD_FILE_MAX_SIZE或PARSE_FILE_TIMEOUT_SECONDS参数设置过小,文件超出系统处理能力或解析时间限制。 - 在模型提供商页面配置的模型测试成功,但在FastGPT中新增模型后测试报错
404。原因在于modelId填写错误,或 OneAPI 中模型路由配置与 FastGPT 期望的名称不符,导致请求未能正确转发。
怎么确认配好了
- 上传具有代表性的供应商审计报告,检查知识库分段预览是否完整,无明显语义截断。
- 针对审计报告中的特定不符合项或CAPA记录,提问模型,核对模型输出答案是否准确引用原文,并检查引用的文档片段是否正确。
- 模拟复杂的审计查询场景,例如跨文档信息整合,观察模型是否能有效召回并综合多个文档片段给出连贯且逻辑正确的回答,并根据业务专家反馈设定合理阈值。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。