这个品类的数据长什么样
药物经济学数据主要来源于临床试验报告、真实世界研究(RWE)数据、药物注册批文、国家医保目录、药品采购价格数据、以及相关政策法规文本。这些数据更新频率不一,临床指南和医保政策可能每年或不定期更新,而药品价格数据更新更为频繁。文档结构多样,包括结构化的数据库记录、半结构化的报告(如 HTA 报告)、以及非结构化的研究论文与政策文件。关键字段包括药物名称、适应症、治疗方案、成本(直接与间接)、效果(QALY、DALY)、效用值、支付方信息、以及研究方法与结果。成本单位常涉及人民币、美元等货币单位,效果单位则常为生命质量调整生命年(QALY)。
这些特征在「知识库检索与召回」这一环带来什么约束
药物经济学数据的多样性要求知识库能够处理多种文档格式,同时对不同类型数据进行有效分段和索引。由于部分数据更新频繁,知识库需要支持增量更新与版本管理,确保检索结果的时效性。成本与效果等关键数值的准确性对检索结果的可靠性至关重要,需要高精度的实体识别与数值抽取能力。文档中可能存在的术语交叉、缩写以及不同研究方法导致的结果差异,对召回算法的语义理解能力提出了更高要求。部分文档内容可能存在冲突或差异,这要求检索结果能够提供多源信息,并辅助用户识别潜在矛盾。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500–800 字符 | 药物经济学报告常包含详细论证,长分段有助保留上下文完整性 |
分段重叠长度 | 100 字符 | 确保相邻段落间的语义连续性,避免关键信息被切断 |
召回条数 | 前 5–8 条 | 考虑到药物经济学分析的复杂性,需要多角度信息支撑 |
相似度阈值 | 0.75 | 兼顾精确匹配和语义相关性,避免遗漏相关性高但措辞不同的文档 |
重排返回条数 | 3 条 | 在初次召回的基础上,进一步聚焦最核心、最相关的几条信息 |
文本理解模型 | FastGPT-Rerank-v1.0 | 针对中文生物医药领域优化,提高语义理解和召回准确性 |
容易做错的三处
- 知识库查询后返回的文档列表为空,或只返回少量不相关文档。原因可能在于
相似度阈值设置过高,导致严格过滤掉部分相关但相似度未达标的文档。 - AI回答中未引用到知识库中的最新数据,而是引用了过期的政策或价格信息。原因通常是知识库的更新机制未及时触发,或索引重建滞后于数据源更新。
- 在配置工作流时,
knowledgeSearch变量动态传值后,AI回答中未出现引用的文档。这可能是因为动态传入的查询参数与知识库索引词条不匹配,或召回条数设置过低,未能召回足够多的文档供LLM引用。
怎么确认配好了
- 对典型药物经济学问题进行查询,检查返回的引用文档是否包含关键成本、效果数值及相关研究方法。
- 选取近期更新的医保政策或药品价格数据,验证知识库查询结果中是否能召回并引用到这些最新信息。
- 针对存在潜在冲突的数据点(如不同研究对同一药物的成本-效果分析结果),测试查询结果是否能同时召回并呈现多源信息,辅助用户进行比对。
- 评估AI回答中引用的知识库文档来源是否多样化,覆盖临床指南、HTA报告、价格数据等不同类型。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。