这个品类的数据长什么样
临床前安评制度数据主要来源于国家药品监督管理局(NMPA)、国际人用药品注册技术协调会(ICH)等官方发布的指导原则、技术审评要求、法规文件,以及各机构内部制定的标准操作规程(SOP)、检验方法学文件、报告模板等。数据更新频率相对较低,通常随法规修订或技术进步而更新,年度更新或数年更新一次。文档结构以 PDF、Word、Excel 等格式为主,内容涵盖实验动物福利、毒理学研究、药代动力学评估、生物样本分析等多个方面。字段与单位具有高度专业性,例如剂量单位 mg/kg、时间单位 h、浓度单位 μg/mL,以及各种毒性分级标准、统计学指标等。
这些特征在「引用来源与溯源」这一环带来什么约束
数据来源的权威性与专业性,要求引用来源必须精准指向原始文档的具体章节或段落,确保答案的合规性与可信度。更新频率低意味着知识库内容相对稳定,但在法规更新时,需要及时进行全量或增量更新,并确保旧版本与新版本之间的溯源逻辑清晰。文档格式多样性,特别是大量 PDF 和扫描件,对文档解析和文本抽取能力提出了较高要求,需要确保文本内容无损提取,尤其是表格和图注信息。专业字段与单位的严谨性,使得模型在生成答案时必须准确复述原文中的数值和单位,避免因单位转换或数值偏差导致的结果误判,因此在引用溯源时需特别关注文本片段的完整性与上下文语境。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500 字符 | 临床前安评制度文档通常包含长段落描述,避免切分造成语义中断,同时确保单段信息量适中。 |
召回条数 | 前 8 条 | 考虑到制度文档的严谨性,需要足够多的上下文信息来支撑回答,避免漏掉关键条款。 |
相似度阈值 | 0.75 | 确保召回的片段与查询问题高度相关,减少无关信息干扰,提高溯源准确性。 |
重排返回条数 | 前 5 条 | 在召回基础上进行二次排序,进一步筛选出最相关的片段,优化最终引用的质量。 |
maxContext | 4096 tokens | 保证模型能够处理较长的上下文信息,尤其是涉及多条款交叉引用的复杂问题。 |
CHUNK_OVERLAP | 50 字符 | 适当的块重叠有助于在分段边界处保留上下文,提高 RAG 召回的连贯性。 |
容易做错的三处
- 引用结果中出现与问题无关的制度条款,现象是模型回答出现不相关内容,原因是没有对召回结果进行有效过滤或重排。
- 引用来源指向的文档页码或章节不准确,现象是用户点击引用链接后发现内容不符,原因可能是文档解析器对目录结构识别有误或分段逻辑导致引用片段与原文位置偏差。
- 模型回答中引用了过时的法规或SOP版本,现象是模型给出的规定与当前最新要求不符,原因是没有及时更新知识库或版本管理机制失效,导致旧数据被召回。
怎么确认配好了
- 针对典型安评问题,检查模型回答中引用的制度条款是否准确,并核对每个引用链接是否能直接定位到原文中对应的段落或页码。
- 选取一份已更新的安评制度文件,验证知识库更新后,模型是否能正确引用新版本内容,并确认旧版本内容不再被引用。
- 使用包含专业术语和单位的查询,评估模型回答中是否准确复述了原文中的数值和单位,且引用来源能支撑这些专业信息。
- 通过模拟法规冲突或多方引用场景,检查模型是否能合理整合多个来源信息,并清晰标示各引用出处。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。