这个品类的数据长什么样
药物经济学领域的质量文档主要包括成本效益分析报告、预算影响分析报告、药物价值评估报告以及相关的方法学指南与共识。这些文档通常来源于制药企业、学术机构、政府卫生部门以及专业咨询公司。其更新节奏受新药上市、治疗指南修订、医保政策调整等因素影响,通常为每年或每两年进行一次重大修订,部分数据(如药品价格、疾病流行率)可能更新更频繁。文档结构严谨,包含摘要、背景、方法、结果、讨论和结论等标准章节。数据字段涉及药物价格、疾病发病率、治疗路径、临床疗效数据(如 QALY、DALY)、医疗资源消耗、社会成本等,单位多样,如人民币元、美元、年、人、百分比等,并常伴有敏感性分析结果和不确定性区间。
这些特征在「引用来源与溯源」这一环带来什么约束
药物经济学文档的数据来源多样且更新频率不一,要求 RAG 检索系统在引用时能够精确指向原始数据出处,并能识别不同版本间的差异。文档中包含大量表格、图表和统计数据,这使得传统文本分段方式可能丢失上下文,影响引用的准确性。例如,一个关于 QALY 的数值,其具体计算方法、假设参数和不确定性范围可能分布在文档的不同部分。此外,不同经济学模型(如决策树、马尔可夫模型)的参数和结果互相关联,溯源时需要能够整合跨章节的信息。对金融单位和医学单位的精确识别,也是确保引用不产生歧义的关键。系统需支持对数值型数据的范围检索和多维度筛选,以应对敏感性分析结果的引用需求。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500–800 字符 | 药物经济学文档段落较长,包含复杂逻辑和数据,此长度有助于保持上下文完整性。 |
召回条数 | 前 8–12 条 | 确保覆盖不同数据源和模型假设,提高对复杂经济学分析的全面理解。 |
相似度阈值 | 0.78–0.85 | 平衡召回率与精确度,避免召回不相关的医学或统计学通用文本。 |
重排返回条数 | 前 5 条 | 优先展示与查询最相关的核心结论和关键数据,减轻模型处理负担。 |
maxContext | 3000–4000 tokens | 适应复杂经济模型和多参数分析,确保模型能处理足够多的引用信息。 |
知识库最大引用 | 3–5 处 | 避免引用过多导致模型混淆,聚焦于关键证据和数据来源。 |
容易做错的三处
- 模型在回答中未能提供具体的数值来源或报告名称,现象为回答中只有结论,缺少具体报告名称和页码等可追溯信息。原因在于知识库切片粒度过大或引用来源信息未被有效嵌入元数据。
- 在生成关于成本效益的回答时,出现不同币种或时间点的数据混用而未加说明,现象为回答中数值单位不一致或数值前后矛盾。原因在于文档处理时未对数值型字段进行标准化或上下文识别不足。
- API 接口返回的引用信息格式混乱,或者包含了大量非关键的引用文本,现象为引用内容冗余且难以阅读。原因在于
知识库最大引用或maxContext参数设置不当,导致模型引用了过多的非核心片段。
怎么确认配好了
- 针对典型的药物经济学查询,检查模型回答中提供的引用来源是否能准确指向原始文档的具体章节或页码。
- 验证模型对包含数值型数据的查询,其引用结果是否能体现原始数据的单位、时间和统计范围。
- 测试不同复杂度的药物经济学问题,评估生成回答的准确性,并对照原始文档核实关键结论的支撑依据。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。