这个品类的数据长什么样
药物经济学制度的数据主要来源于国家医保局、卫健委、各省市药采平台发布的政策文件、指南、专家共识,以及药品企业提交的药物经济学评价报告。这些文档通常以 PDF 格式为主,包含大量表格、图表和复杂的文本描述,更新频率相对较低,通常为季度或年度。文档结构上,存在大量嵌套标题、列表和引用。字段方面,涉及药品通用名、适应症、治疗方案、成本、疗效、效用、ICER (增量成本效果比) 等专业术语,单位则包括人民币、美元、QALY (质量调整生命年)、LY (生命年) 等,且不同报告的单位可能存在差异。
这些特征在「工具调用与插件」这一环带来什么约束
药物经济学文档的复杂性对工具调用与插件提出了特定要求。PDF 文档中表格和图表的存在,意味着需要强大的文档解析能力,将非结构化数据准确抽取为可结构化查询的信息。更新频率低,使得在知识库中建立长期、稳定的索引成为可能,但也要求在更新时能够有效识别版本差异。多样的字段和单位,特别是 ICER 等核心指标,需要在工具调用时进行标准化或映射,以确保计算和比较的准确性。同时,由于制度问答往往涉及多份文件的交叉引用,对知识库的召回策略和上下文管理提出了更高要求,避免单一文件信息不足导致回答不完整。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
UPLOAD_FILE_MAX_SIZE | 500 MB | 药物经济学报告通常较大,包含图表和附件。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 复杂 PDF 解析耗时较长,防止因超时导致解析失败。 |
分段长度 | 800–1200 字符 | 确保单个段落包含足够上下文,兼顾召回效率。 |
召回条数 | 前 8 条 | 制度问答常需多角度信息支持,增加召回覆盖度。 |
相似度阈值 | 0.78 | 区分专业术语的细微差异,提高相关性。 |
重排返回条数 | 前 5 条 | 精炼最终提供给模型的上下文,聚焦核心信息。 |
容易做错的三处
- 文档解析后表格内容缺失或错位:原因在于 PDF 解析器对复杂表格结构的支持不足,导致结构化信息提取失败。
- 回答中 ICER 数值或单位错误:原因在于知识库中原始数据单位未标准化,或模型在引用时未进行单位换算。
- 针对特定政策条文的问答结果不完整:原因在于
召回条数过少或分段长度不足,未能提供足够的上下文信息给模型。
怎么确认配好了
- 上传一份包含复杂表格和图表的药物经济学报告 PDF 文件,检查解析后的文本内容是否完整且结构正确。
- 针对报告中的关键药物经济学指标(例如 ICER 值),提出问题并核对回答中提供的数值与单位是否与原文一致。
- 选取报告中涉及多章节或多份文件交叉引用的制度条款,进行提问,评估回答的全面性和逻辑连贯性。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。