这个品类的数据长什么样
GMP 合规制度的数据主要来源于国家药品监督管理局、国际药监机构发布的法规文件、行业协会发布的指导原则、以及企业内部制定的质量管理体系文件(如 SOP、批生产记录、验证报告等)。这些文档以 PDF、Word、或内部知识管理系统页面形式存在。法规文件更新频率相对较低,通常为数年一次,但一旦发布修订,影响范围广。企业内部 SOP 和指导原则更新则取决于生产工艺变更、设备引进或监管要求调整,可能每月或每季度进行修订。文档结构通常包含严格的章节编号、条款内容、修订历史和附件,字段常涉及批次号、生效日期、修订版本号、文件编号等,部分文件中还包含流程图和表格数据。
这些特征在「引用来源与溯源」这一环带来什么约束
GMP 合规文档的权威性和严谨性,要求 AI Agent 在回答时必须提供精确的引用来源,以支持其合规性判断。法规和 SOP 的修订历史,使得版本溯源成为关键,确保引用的是当前生效的最新版本,或根据提问时间点引用特定历史版本。文档中大量的专业术语和缩写,要求知识库能够准确识别并关联上下文。此外,文件编号、生效日期等元数据是判断文档适用性的重要依据,在召回和引用时需重点关注。当知识库内容与用户提问关联度不高时,不应返回无关内容,这要求召回策略具备高精度和低召回冗余。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500-800 字符 | GMP 文档条款通常较长,避免过度切割导致上下文丢失,同时兼顾向量检索效率。 |
分段重叠长度 | 50-100 字符 | 确保段落衔接处的信息不丢失,提高检索召回率。 |
召回条数 | 前 5-8 条 | 考虑到文档的严谨性,多召回几条相关条款有助于模型综合判断。 |
相似度阈值 | 0.75-0.85 | 保证召回内容的精确性,避免不相关的法规条款被引用。 |
重排返回条数 | 前 3 条 | 经过重排后,聚焦于最相关的少数几条,减少模型处理负担并提高答案准确性。 |
元数据过滤 | 生效日期 >= 当前日期 | 确保只引用最新生效的法规和 SOP 版本。 |
容易做错的三处
- 模型返回的引用链接指向了 Notion 内部链接,用户无法直接访问,原因是知识库在导入时未将
Notion链接转换为公开可访问的 URL。 - 用户提问关于特定批次号的合规问题,模型未能引用到相关的批生产记录,原因是知识库未对文档中的表格数据进行有效解析和索引。
- 当用户用中文提问时,模型无法引用知识库中的英文 GMP 文档,原因是分词器或向量模型未针对多语言混合内容进行优化,导致语义匹配失败。
怎么确认配好了
- 选取多个典型合规问题,测试模型回答是否能提供精确到条款的引用来源,并检查引用链接是否可直接访问。
- 随机抽取已失效的旧版 SOP 或法规,向模型提问相关内容,验证模型是否能通过
元数据过滤机制避免引用这些过期文档。 - 提交包含特定文件编号、批次号或生效日期的查询,核对模型返回的引用是否准确匹配这些元数据信息。
- 对比模型针对中英文混合提问的引用效果,确保知识库在多语言环境下仍能有效召回并引用相关文档。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。