这个品类的数据长什么样
罕见病相关数据主要来源于国家药品监督管理局(NMPA)、FDA、EMA 等监管机构发布的药物上市后监测报告、临床试验报告、真实世界研究(RWE)数据、医学文献、以及患者注册登记系统。这些数据更新频率不一,监管机构报告通常按季度或年度发布,医学文献则持续更新。文档结构以非结构化文本为主,例如病例报告、研究论文、新闻报道,但也包含半结构化数据,如药物说明书、不良事件报告表(CIOMS I 或 MedWatch 3500A)。字段涵盖患者人口统计学信息、疾病诊断、用药情况(剂量、疗程)、不良事件描述、严重程度、结局等,单位涉及剂量单位(mg、g)、频率单位(次/日、次/周)、时间单位(小时、天、年)等。
这些特征在「引用来源与溯源」这一环带来什么约束
罕见病数据来源分散且更新频率不均,使得知识库构建时需要关注多源数据整合与版本管理。非结构化文本占比较高,对 RAG 召回的文本切片质量提出更高要求,需确保切片能完整包含不良事件的描述上下文。半结构化数据中的字段,例如药物剂量和不良事件严重程度,需要精准识别和提取,以便在引用时提供准确的量化信息。由于罕见病患者数量少,单个不良事件报告可能具有独特价值,这要求引用溯源机制能够精确指向原始报告,避免信息丢失或泛化。同时,数据中可能包含敏感的患者信息,在引用和展示时需要确保脱敏处理,并遵循数据隐私法规。对特定不良反应的讨论,往往需要聚合多个来源的零散信息,因此对引用来源的聚合与去重能力也提出了要求。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 300-500 字符 | 兼顾罕见病不良事件描述的完整性与召回效率 |
重叠长度 | 50 字符 | 确保相邻分段的上下文连续性,减少信息割裂 |
召回条数 | 8-12 条 | 平衡召回广度与大模型处理 token 限制,避免遗漏关键信息 |
相似度阈值 | 0.75-0.85 | 过滤低相关性文档,提高召回精准度,应对数据稀疏性 |
最大引用token数 | 1500 token | 避免因引用过长导致大模型上下文溢出,同时提供足够信息进行溯源 |
引用来源显示模式 | 仅标题与链接 | 确保溯源可见性,同时不占用过多回答空间,方便用户点击查阅原始报告 |
容易做错的三处
- 回答中引用的文档数量远超预期,导致回答冗长且 token 消耗过高,原因是
召回条数或最大引用token数配置过大,未能有效限制引用范围。 - 回答中出现与罕见病药物警戒主题不相关的引用内容,这可能是
相似度阈值设置过低,导致召回了大量噪声信息。 - 引用的来源链接指向错误或无法访问,通常是知识库导入时源文件路径或元数据字段
source_url未正确维护,或原始数据源已变更。
怎么确认配好了
- 随机抽取 5-10 个罕见病不良反应相关查询,检查回答中引用的文档是否精准且与问题高度相关,并记录召回的文档数量。
- 检查回答中引用的来源链接是否均可正常访问,并能定位到原始信息点。
- 评估回答中引用的内容是否完整覆盖了原始文档的关键信息,特别是罕见病不良事件的详细描述、剂量和发生时间等。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。