这个品类的数据长什么样
供应商审计在生物医药注册申报中,数据主要来源于供应商提供的质量体系文件、生产工艺文件、检验报告、变更记录、偏差处理报告、CAPA(纠正预防措施)文件等。这些文档通常以 PDF、Word 文档、Excel 表格、扫描件等多种格式存在。更新节奏不一,核心文件如质量手册、质量协议可能年度更新或遇重大变更时更新;批生产记录、检验报告则随批次持续产生。文档结构复杂,例如质量手册有明确的章节划分,而批生产记录则包含大量结构化和非结构化数据,如生产日期、批号、操作员签名、设备参数、物料批次、检测结果、异常记录等,其中字段与单位高度专业化,如温度单位(℃)、压力单位(kPa)、浓度单位(mg/mL)、纯度百分比(%),以及各种符合药典标准的检测方法编号。
这些特征在「引用来源与溯源」这一环带来什么约束
供应商审计数据的多样性和复杂性,对引用来源与溯源提出了特定约束。首先,文档格式的异构性要求系统具备强大的多格式解析能力,确保所有信息都能被有效提取。其次,更新节奏的不一致性意味着知识库需要支持增量更新和版本管理,以反映供应商文件的最新状态,并能追溯历史版本。再次,文档内容的专业性和结构化程度差异,要求在知识切片时,既能识别并保留批生产记录中的关键字段及其数值,又能处理质量体系文件中的长篇描述性文本。特别地,对批号、日期、特定参数值等关键信息的准确提取和关联,是确保溯源链条完整性的核心,这直接影响到RAG(检索增强生成)模型在生成申报资料时引用信息的准确性。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | 兼顾长篇描述性文件与结构化数据,避免切片过碎丢失上下文,或切片过长稀释信息密度。 |
召回条数 | 前 10–15 条 | 供应商审计文档常涉及多方面信息,增加召回量有助于捕获潜在关联,提高引用全面性。 |
相似度阈值 | 0.75 | 严格的相似度有助于筛选出高度相关的片段,减少不准确或无关信息的引用。 |
重排返回条数 | 前 5 条 | 经过重排模型进一步精炼,确保最终引用的内容是与问题最直接相关的核心信息。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 应对大型 PDF 或扫描件解析可能耗时较长的情况,防止解析中断。 |
MAX_CHUNK_OVERLAP | 100 字符 | 保证相邻分段间有适当重叠,避免关键信息被切断或上下文不完整。 |
容易做错的三处
- 生成内容中引用的批号、日期或特定检测结果与原始文档不符,原因是知识切片时未正确识别或提取结构化数据中的关键字段。
- 在检索供应商质量体系文件时,系统返回了旧版本的文档内容,导致引用信息过时,原因是知识库未配置版本管理或增量更新机制。
- 面对扫描版的供应商资质证书或检验报告,系统无法提取文本信息,导致引用来源缺失,原因是未配置或启用OCR(光学字符识别)处理流程。
怎么确认配好了
- 选择一份包含多种数据类型的供应商审计报告,验证RAG模型生成的引用内容是否能准确指向报告中的具体段落、表格或数值。
- 上传一份更新后的供应商质量协议,并尝试提问,检查系统是否优先引用最新版本的信息,并能追溯到旧版本。
- 针对批生产记录中的关键参数(如温度、压力、纯度),提问并核对引用是否能精确到数值和单位,并指向原始记录中的对应位置。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。