这个品类的数据长什么样
罕见病领域的注册申报数据具有其特殊性。数据来源高度依赖于全球各国的药品监管机构发布的信息,例如美国 FDA、欧洲 EMA、日本 PMDA 等,以及各类罕见病数据库,如 ORPHANET、GARD。这些数据更新频率不一,新药审批和临床试验结果发布可能每月更新,而疾病流行病学数据或基因组学信息则更新周期较长。文档形式多样,包括官方指南、临床试验报告(CTR)、上市申请文件、科学咨询意见、同行评审论文等,多为 PDF、Word 或结构化数据库条目。字段与单位方面,常见有药物靶点(基因/蛋白)、适应症描述、临床试验终点(如 OS、PFS)、不良事件发生率、用法用量(mg/kg、IU/m²)、以及罕见病特有的流行病学数据(患病率、发病率)。
这些特征在「引用来源与溯源」这一环带来什么约束
罕见病数据来源的多样性与更新频率差异,直接影响了知识库构建的策略。PDF 和 Word 文档的自动解析质量至关重要,特别是对表格和图表内容的提取。由于数据更新不规则,知识库的同步机制需支持增量更新,并能识别不同版本文档间的差异。注册申报资料对引用来源的准确性要求极高,任何引用的偏差都可能导致审查风险。这意味着 AI Agent 在生成内容时,不仅需要召回相关信息,还必须精确指向原始文档的具体页码或段落。此外,罕见病领域专业术语多,同义词或近义词的识别能力,以及对剂量、单位等数值型信息的精确匹配,是确保溯源准确性的关键。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | 兼顾罕见病临床试验报告的段落长度与上下文连贯性,避免信息碎片化。 |
召回条数 | 前 5-7 条 | 确保覆盖多个潜在相关来源,平衡召回率与后续处理的复杂度。 |
相似度阈值 | 0.78–0.85 | 适应罕见病术语的专业性和精确性要求,过滤低质量召回结果。 |
重排返回条数 | 3 条 | 聚焦于最相关的高质量引用,减轻后续大语言模型处理负担。 |
maxContext | 8000 tokens | 应对罕见病注册申报资料的复杂性和深度,提供足够长的上下文窗口。 |
ENABLE_INCREMENTAL_UPDATE | True | 应对罕见病数据的不定期更新,确保知识库内容时效性。 |
容易做错的三处
- AI Agent 生成内容后,引用的文献链接无法点击或指向错误页面。原因在于知识库在导入时未正确解析文档内嵌链接,或存储路径发生变更。
- 工作流中调用知识库后,返回的引用信息不完整或缺失关键数值。原因在于文档解析模块对表格或复杂结构化数据的提取能力不足,导致关键字段丢失。
- 查询罕见病药物剂量时,AI Agent 提供的数值与原始文献不符。原因在于知识库索引过程中未区分不同单位(如 mg/kg 与 mg/m²),或未进行单位归一化处理。
怎么确认配好了
- 选取多个典型罕见病注册申报问题,验证 AI Agent 生成答案后,点击引用来源是否能准确跳转到原始文档的对应位置。
- 针对包含复杂表格的临床试验报告,测试知识库对关键指标(如不良事件发生率、主要终点数据)的提取与引用是否完整无误。
- 随机抽取一批罕见病药物的用法用量信息,通过查询验证 AI Agent 对数值型数据的引用是否精确,并检查单位是否一致。
- 模拟罕见病新药获批或指南更新场景,上传新版文档,观察知识库是否能识别并进行增量更新,且不影响原有信息的引用准确性。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。