这个品类的数据长什么样
药物经济学注册申报资料通常包含药物成本效益分析、成本效果分析、成本效用分析等报告。这些报告的数据来源广泛,包括临床试验数据、真实世界证据(RWE)、国家或地区医保支付标准、药品采购价格、疾病流行病学数据、患者生活质量评估量表(如 EQ-5D)等。数据更新频率不一,临床数据和支付标准可能每年更新,而流行病学数据更新周期较长。文档结构复杂,常包含大量图表、统计学结果、敏感性分析、模型构建细节及参考文献。字段涉及药品通用名、剂型、规格、价格、治疗方案、疗效指标(如 QALY、LYG)、不良事件发生率、资源消耗、卫生服务利用等,单位包括货币单位(如元、美元)、时间单位(年、月)、生命质量调整生命年(QALYs)等。
这些特征在「知识库检索与召回」这一环带来什么约束
药物经济学资料的复杂结构和多源数据特性,对知识库的检索与召回提出了多重约束。大量图表和统计结果使得纯文本分段难以完整保留信息,需要增强对非文本内容的解析能力。数据更新频率的不一致性要求知识库能够支持精细化的文档版本管理和增量更新,以确保召回信息的时效性。字段和单位的特殊性,如 QALYs、不同货币单位,要求向量模型能理解这些专业术语的语义,并区分数值的上下文。此外,报告中常包含复杂的因果关系和模型假设,简单的关键词匹配容易导致断章取义或信息缺失,需要更高级的语义理解和上下文关联能力,以确保召回的片段能够提供完整的论证链条。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
UPLOAD_FILE_MAX_SIZE | 500 MB | 药物经济学报告可能包含大量图表和模型数据,文件较大。 |
分段长度 | 800–1200 字符 | 确保能够捕获完整的论证段落和上下文信息。 |
重叠长度 | 150 字符 | 维持分段间的上下文连续性。 |
召回条数 | 5–8 条 | 平衡召回的全面性与无关信息的干扰。 |
相似度阈值 | 按实测标定 | 需根据具体模型和数据集进行调整,平衡查全率和查准率。 |
重排返回条数 | 3 条 | 优先展示最相关的核心信息。 |
容易做错的三处
- 上传大型 PDF 报告时,系统显示
文件大小超出限制错误,因为UPLOAD_FILE_MAX_SIZE配置过小。 - 多轮对话后,关于药物经济学模型参数的追问,模型回答出现前后矛盾,原因在于知识库分段过短,导致关键上下文被切断。
- 查询特定药品的成本效益数据时,召回结果中包含大量无关的临床试验数据,未能准确聚焦到经济学评价内容,这是因为
相似度阈值设置过低或向量模型对专业术语的理解不足。
怎么确认配好了
- 上传具有代表性的药物经济学报告,检查文件是否能成功解析,并能在知识库中预览到完整内容。
- 针对报告中的关键结论、模型假设、敏感性分析结果等,进行多轮提问,评估召回片段是否包含回答所需的所有必要信息,并检查回答的逻辑连贯性。
- 输入包含专业术语(如 QALY、ICER)的查询,检查召回结果是否准确聚焦到相关段落,并对比不同
相似度阈值下的召回准确率和召回数量,以确定合适的阈值范围。 - 模拟实际申报资料准备场景,提出涉及跨文档信息整合的问题,观察系统是否能有效关联不同来源的数据并提供综合性回答。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。