这个品类的数据长什么样
供应商审计的质量文档主要包括审计报告、不符合项清单、纠正预防措施 (CAPA) 记录、供应商质量协议 (QAA) 和相关法规标准。这些文档通常以 PDF、Word 或扫描图片形式存在,内容结构化程度不一。审计报告通常有固定的章节,包含审计范围、发现、结论等,但细节描述可能自由度较高。CAPA 记录则包含问题描述、根本原因分析、实施措施及验证结果等字段。数据更新频率相对较低,通常随审计周期(年度或更长)进行,或在发生重大不符合项时更新。文档中常出现生物医药领域的专业术语、缩写以及特定批号、序列号等唯一标识符。
这些特征在「知识库检索与召回」这一环带来什么约束
供应商审计文档的半结构化特性要求知识库在切片时能兼顾语义完整性和局部细节。例如,审计报告中的某个不符合项描述可能跨越多个自然段,简单的按句切分可能导致信息丢失。低更新频率意味着知识库构建时需要一次性处理大量历史文档,对文档解析和嵌入效率有要求。专业术语和缩写的存在,对嵌入模型识别领域概念的能力提出要求,避免因词汇不匹配导致召回失败。字段与单位的特殊性,如药品批号、生产日期、特定检测数值范围,要求检索系统能够精确匹配或识别近似值,以便在回答诸如“某批次产品是否通过了某项审计”时提供准确证据。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500–800 字符 | 兼顾审计报告中不符合项描述的完整性,避免关键信息被切断。 |
召回条数 | 8–12 条 | 确保覆盖多个潜在相关的审计发现、CAPA记录或QAA条款,增加信息覆盖面。 |
相似度阈值 | 0.75–0.85 | 平衡召回精度与召回率,减少不相关文档的干扰,同时不漏掉高度相关的文档。 |
重排返回条数 | 3–5 条 | 在初次召回的基础上,通过重排模型进一步筛选出与查询意图最匹配的少数高质量文档。 |
maxContext | 3000 Tokens | 为确保大模型处理审计报告或CAPA记录时有足够的上下文理解能力。 |
EMBEDDING_MODEL | text-embedding-ada-002 或领域专用模型 | 确保对生物医药领域专业术语有较好的理解和向量化能力。 |
容易做错的三处
- 知识库查询结果未能提供相关文档中的具体批号或日期信息,而是给出了泛泛的描述。原因在于切片粒度过大或嵌入模型对数字和特定标识符的敏感度不足,导致关键事实信息在向量化过程中被稀释或忽略。
- 上传大量历史审计文档后,知识库检索响应时间显著增加或出现超时错误。原因可能是
PARSE_FILE_TIMEOUT_SECONDS设置过短,无法处理复杂或大文件,或者UPLOAD_FILE_MAX_SIZE限制了文件大小,导致部分重要文档无法成功入库。 - 在 FastGPT API 调用中,即使知识库已关联,生成的回复也没有引用文档内容。原因可能是 API 调用时未正确传递
kb_ids参数,或者相似度阈值设置过高,导致模型认为没有足够相关的文档可引用。
怎么确认配好了
- 针对典型审计查询,如“查询某供应商在特定年份的审计不符合项”,检查返回结果的引用中是否包含对应的审计报告或 CAPA 记录,并核对其中提及的批号、日期等关键信息是否准确。
- 上传一份包含复杂表格和专业术语的审计报告,观察知识库在
分段长度和召回条数的配置下,能否正确切分并召回包含表格内容或特定术语的段落。 - 进行模拟审计场景提问,例如“某批次原料药的质量协议有哪些关键条款”,检查模型回答中是否能准确引用到供应商质量协议(QAA)中的具体条款,并评估召回结果的
相似度阈值是否能有效筛选出相关内容。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。