这个品类的数据长什么样
供应商审计在生物医药研发中,其文档主要源于审计报告、质量协议、供应商资质文件、生产批记录以及变更控制记录。这些数据更新频率相对较低,通常为季度或年度更新,但涉及重大变更时会即时更新。文档结构以半结构化为主,包含大量非标准化的文本描述、表格数据和嵌入式图表。关键字段包括供应商名称、审计日期、不符合项描述、整改措施、完成日期、批次号、产品名称以及相关的质量标准(如 GMP、ISO 13485)。单位涉及温度(℃)、压力(kPa)、浓度(mg/mL)等。
这些特征在「知识库检索与召回」这一环带来什么约束
供应商审计文档的半结构化特性要求知识库在切分时能识别并保留表格与关键描述的上下文关联,避免信息碎片化。更新频率较低意味着可以在数据导入时进行更深度的预处理和向量化,但需要关注增量更新的策略。文档中包含的专业术语和缩写,如“CAPA”(纠正与预防措施)、“OOS”(超标结果),对检索模型的分词能力和语义理解提出要求。多种单位的混杂则需要模型具备一定的单位识别与归一化能力,以支持基于数值范围的查询。嵌入式图表的存在,意味着纯文本检索可能无法完全覆盖所有信息,需要考虑多模态信息的整合。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500–800 字符 | 兼顾审计报告中段落的完整性与召回时的相关性,避免过长上下文引入噪声。 |
分段重叠 | 50–100 字符 | 确保跨段落的关键信息不会因切分而丢失上下文,特别是审计结论与附件关联处。 |
召回条数 | 前 8–12 条 | 考虑到审计报告复杂性,增加召回数量以提高发现潜在关联不符合项的概率。 |
相似度阈值 | 0.75–0.85 | 针对专业术语高度相似的审计记录,提高阈值以确保召回结果的精确性。 |
重排返回条数 | 前 5 条 | 在初次召回后,通过重排模型进一步筛选出与查询意图最相关的审计记录或整改建议。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 审计报告可能包含大量内容,延长解析时间以确保大型文档的完整处理。 |
容易做错的三处
- 知识库信息提取为空:这通常是由于文档解析器未能正确识别审计报告中的关键字段或表格结构,导致内容未能有效切分并索引。
- 相似问题召回混淆:例如“供应商A的CAPA流程”与“供应商B的CAPA流程”混淆,原因是向量模型未能有效区分实体信息,或者分段时未保留足够的实体上下文。
- 无法输出文档中已有的图片:这表明知识库处理流程未能将嵌入在审计报告中的图片(如不符合项现场照片)进行提取、OCR识别或与文本内容建立关联。
怎么确认配好了
- 上传典型审计报告,检查知识库预览中分段内容是否完整,特别是表格数据和关键结论是否被正确识别。
- 针对特定不符合项或整改措施进行查询,观察召回结果是否包含相关供应商、审计日期和具体批次信息,并检查
召回条数是否符合预期。 - 使用包含专业术语和缩写的查询(如“OOS处理流程”),验证召回结果的精确性,并评估
相似度阈值是否能有效过滤无关信息。 - 测试查询涉及数值范围的审计结果(如“温度超标范围”),核对系统是否能从文档中正确提取并匹配对应的数值。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。