这个品类的数据长什么样
罕见病相关制度数据主要来源于国家药品监督管理局(NMPA)、国家卫生健康委员会、地方医保局等官方机构发布的法规、指南、目录和通知。这些文档通常以 PDF 格式发布,部分以 HTML 页面形式存在。更新频率不一,国家层面的法律法规通常数年一次重大修订,而地方医保目录或临床指南可能每年更新。文档结构以章节、条目为主,包含大量专业术语、疾病分类编码(如 ICD-10)、药品通用名、适应症、报销范围等。数据中还涉及医学术语、剂量单位(mg/kg)、给药频率等,这些是理解制度文本的关键。
这些特征在「引用来源与溯源」这一环带来什么约束
罕见病制度文档的官方性和法律效力,决定了引用来源的准确性与可溯源性至关重要。PDF 文档中嵌套的表格和图片内容,可能在切分时丢失上下文,影响召回质量。更新频率的不确定性,要求知识库具备版本管理能力,以确保引用的是当前生效的最新规定。疾病分类编码、药品通用名等专有名词的识别,需要优化文本嵌入模型或配置专有名词词典,提高召回精度。剂量单位和给药频率等字段,在问答中需要精确呈现,避免误导,这要求引用片段能准确捕获原文细节,并支持高亮显示。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 400–600 字符 | 罕见病制度文本通常逻辑严谨,单段过长易引入无关信息,过短则上下文不足。 |
召回条数 | 前 5 条 | 制度问答对准确性要求高,增加召回条数有助于覆盖更多相关规定,同时避免冗余。 |
相似度阈值 | 0.75 | 确保召回的片段与用户提问高度相关,降低误引风险。 |
重排返回条数 | 前 3 条 | 在召回基础上进一步精选,优先展示最匹配的制度条款,提高引用质量。 |
ENABLE_PDF_OCR | true | 许多制度文件以扫描版 PDF 形式发布,启用 OCR 确保文本可抽取。 |
EMBEDDING_MODEL_NAME | text-embedding-ada-002 | 适用于处理医学专业术语和法规文本,提高语义匹配准确性。 |
容易做错的三处
- 用户提问后未返回任何引用来源,可能是因为
相似度阈值设置过高,导致相关性稍低的有效段落被过滤。 - 返回的引用来源与用户问题关联度不高,可能是
分段长度过长,单个分段包含过多不相关信息,稀释了关键语义。 - 知识库测试时,部分制度文本中的表格数据未能被引用,这是因为
ENABLE_PDF_OCR未开启或 OCR 引擎对表格识别能力不足,导致表格内容未被索引。
怎么确认配好了
- 针对国家药品监督管理局发布的《罕见病目录》中的具体疾病,提问其报销政策或用药规定,检查返回的引用来源是否指向最新版本的文件和具体条款。
- 随机选取 10-15 个包含专业医学术语和剂量单位的制度条款,构造问句进行测试,核对引用片段是否完整准确地捕获了这些关键信息,并通过
相似度阈值调整确保召回。 - 上传一份包含复杂表格和图片内容的罕见病临床指南 PDF,提问其中表格数据相关的问题,验证是否能准确引用到表格内的文本内容,检查
ENABLE_PDF_OCR的实际效果。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。