这个品类的数据长什么样
注册申报涉及的质量文档主要来源于药企内部的研发部门、临床部门、生产部门和注册部门,以及外部的合同研究组织(CRO)和合同生产组织(CMO)。数据更新频率相对较低,通常在项目里程碑节点或监管要求发生变化时进行集中修订。文档类型多样,包括但不限于研究报告、实验记录、批生产记录、检验报告、稳定性研究报告、临床试验报告、非临床研究报告等,常以 PDF、Word 或扫描件形式存在。字段与单位具有高度专业性,例如药学研究中的含量、纯度、溶出度(单位如 %、mg/mL、min),临床试验中的受试者编号、剂量、不良事件(单位如 mg、次),以及质量标准中的检测方法、限度(单位如 ppm、CFU/g)。这些文档往往结构复杂,包含大量图表、表格和交叉引用。
这些特征在「引用来源与溯源」这一环带来什么约束
注册申报文档的低更新频率意味着知识库构建时对文档版本管理有高要求,需要确保引用来源始终指向当前批准或提交的版本。文档的多样性和复杂结构,特别是大量的图表和表格,对文本提取和语义理解提出了挑战,可能导致关键信息在 RAG 过程中丢失或误解。高度专业化的字段和单位要求 RAG 系统在引用时能准确识别并保留这些信息,避免因单位转换或上下文缺失而产生歧义。例如,剂量信息若缺失单位可能导致严重错误。文档中普遍存在的内部交叉引用,要求系统在溯源时能识别并关联这些内部链接,以提供更全面的上下文。此外,扫描件的存在增加了 OCR 识别的难度,可能引入字符错误,影响引用准确性。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500–800 字符 | 注册申报文档常有长篇描述和复杂逻辑,过短分段易割裂上下文,过长则降低召回精度。 |
分段重叠长度 | 50–100 字符 | 确保段落衔接处的语义完整性,尤其在表格或图表说明文本的边界。 |
召回条数 | 8–12 条 | 注册申报问题往往需要多方面信息支撑,增加召回条数提升覆盖率。 |
相似度阈值 | 按实测标定 | 针对专业术语和长句匹配效果进行调整,避免因专业词汇的低相似度导致漏召。 |
重排返回条数 | 3–5 条 | 聚焦于与注册申报问题最相关的核心证据,减少无关信息干扰。 |
OCR 启用 | true | 注册申报文档中存在大量扫描件,启用 OCR 确保内容全面可检索。 |
容易做错的三处
- 回复内容中出现类似
[引用来源1]的链接,但点击后无法跳转到原始文档的具体位置,原因是文档处理时未正确提取并存储段落的页码或锚点信息,导致溯源链接失效。 - 模型回答中引用了某个批次生产记录的数值,但单位错误或缺失,原因是文档解析时未能准确识别并关联数值与其对应的单位字段。
- 提问关于某个临床试验不良事件的发生率,结果模型回答为空或给出不相关的通用信息,原因是知识库中未能有效识别和提取表格数据,导致关键统计信息未被索引。
怎么确认配好了
- 针对典型注册申报问题进行提问,检查回复中引用的源文档链接是否能准确跳转到原文的对应页码或章节。
- 随机抽取模型回复中的数值引用,核对其单位是否与源文档中的一致,并验证数值的准确性。
- 使用包含表格数据的文档进行测试,检查模型是否能正确理解并引用表格中的特定行或列数据,例如药物剂量、受试者数量等。
- 验证当知识库中存在新版本文档时,模型是否优先引用最新版本的信息,并能追溯到其版本号。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。