这个品类的数据长什么样
合理用药制度的数据主要来源于国家卫生健康委员会、国家医疗保障局发布的各类政策法规、技术指南、药品目录,以及医院内部制定的诊疗规范、处方集、药事管理制度等。这些文档通常以 PDF、Word 或结构化数据库的形式存在。数据更新频率相对稳定,政策法规类每年有数次更新,药品目录可能每季度或半年调整。文档结构多为章节式,包含大量专业术语、药品名称、剂量单位、适应症、禁忌症等字段。其中,药品的通用名、商品名、剂型、规格、给药途径、用法用量等信息尤为关键,常以表格或列表形式呈现。
这些特征在「知识库检索与召回」这一环带来什么约束
合理用药制度的文档结构化程度高,但表述严谨且专业性强,对语义理解和精确匹配要求极高。药品名称的同义词、缩写、不同剂型间的差异,以及剂量单位(如 mg、g、IU)的准确识别,直接影响检索结果的可用性。更新频率虽然不高,但每次更新都可能涉及关键条款的修订或新增,要求知识库能快速响应并更新索引。此外,由于涉及医疗安全,检索结果的准确性和完整性至关重要,需要避免因召回不全或无关信息干扰而导致的误判。对查询中涉及的多个实体(如“某种药”+“某种病”+“剂量”)进行关联召回,是核心挑战。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 300–500 字符 | 制度文本逻辑性强,过短可能切断完整条款,过长增加噪声。 |
分段重叠 | 50 字符 | 确保段落间上下文衔接,避免关键信息被切割。 |
召回条数 | 8–12 条 | 保证多角度覆盖查询意图,兼顾模型处理能力。 |
相似度阈值 | 按实测标定 | 需根据实际查询效果,在准确性与召回率之间找到平衡点。 |
重排返回条数 | 5 条 | 聚焦最相关的结果,减少模型推理负担。 |
maxContext | 4096 tokens | 确保模型能处理足够长的上下文,完整理解制度条款。 |
容易做错的三处
- 知识库未能回答与合理用药制度相关的问题,结果为空。这通常是由于文档分段策略不当,导致关键信息被切割,或者
相似度阈值设置过高,未能召回相关文本。 - 回答中引用了不相关的政策条文或药品说明。原因在于
召回条数过多,或者向量检索的语义理解不足,未能有效区分相似但非目标的内容。 - API 调用返回的回复中缺少知识库引用。这可能意味着 API 请求参数中
use_knowledge_base未设置为True,或者知识库与模型之间的数据流配置存在问题,导致知识库检索结果未能传递给模型进行生成。
怎么确认配好了
- 针对典型合理用药场景(如“某药品在肾功能不全患者中的剂量调整”)进行查询,检查召回结果是否包含所有相关政策条款和药品说明书内容,并确认其完整性。
- 模拟更新后的政策法规,重新上传并索引,然后查询相关内容,验证知识库是否能及时反映最新变化。
- 通过 FastGPT 的调试界面,观察每次查询的
召回条数、相似度分数及最终模型生成的回答,评估回答的准确性与引用来源的可靠性。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。