这个品类的数据长什么样
药物经济学制度的数据主要来源于各国医疗保障机构发布的药品目录、报销政策、价格谈判结果以及相关指南。这些数据更新频率较高,通常按季度或年度发布,部分关键政策调整可能随时发布。文档形式多样,包括 PDF 格式的政策文件、Excel 表格形式的药品清单和报销标准、以及在线数据库的结构化数据。字段方面,特有字段包括药品通用名、商品名、ATC分类码、医保支付标准、报销比例、适应症、限价、以及具体的支付限制条件。单位涉及货币单位(如人民币、美元)、时间单位(如年、月)、数量单位(如毫克、片)、以及比例(如百分比)。数据量庞大且结构化程度不一,部分信息需要从非结构化文本中抽取。
这些特征在「工作流编排」这一环带来什么约束
药物经济学制度数据的多源性与非结构化特性,要求工作流在数据摄取阶段具备强大的文件解析和信息抽取能力。PDF 和 Excel 格式的政策文件需要专门的解析节点进行内容识别与结构化转换。高更新频率则要求工作流支持定时触发与增量更新机制,以确保知识库的时效性。字段的复杂性与多样性,特别是包含大量专业术语和数值型数据,对知识分段和向量化精度提出更高要求,需要针对性地配置分段策略,避免关键信息被割裂。同时,医保支付标准和报销比例等数值字段的精确性,决定了工作流在问答环节必须能够准确识别并引用这些数值,避免因模糊匹配导致结果偏差。对于支付限制条件等复杂文本描述,工作流需能进行多跳推理,综合多条规则得出结论。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | 确保政策条款的完整性,减少关键信息被切分导致语义丢失。 |
召回条数 | 前 8–12 条 | 考虑到政策条文的复杂性与相互关联性,增加召回范围以捕获更多上下文。 |
相似度阈值 | 按实测标定 | 依据具体数据集和模型表现,通过测试调整以平衡召回率与准确率。 |
重排返回条数 | 前 3 条 | 结合重排模型能力,在保证相关性的前提下,减少冗余信息干扰。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 处理大型 PDF 政策文件和复杂 Excel 表格时,预留充足的解析时间。 |
全局变量 policy_date | 自动从文件名或文档内容中提取 | 许多政策文件会在名称或正文中包含发布日期,用于时间维度筛选与追溯。 |
容易做错的三处
- 现象:用户提问关于特定药品报销比例时,返回结果缺失关键数值。原因:知识分段过短,导致报销比例数值与描述性条件在不同段落,无法同时召回。
- 现象:工作流执行过程中,PDF 解析组件报错
TimeoutError。原因:PARSE_FILE_TIMEOUT_SECONDS参数设置过低,未能处理部分体积大或结构复杂的政策文件。 - 现象:API 调用
mcp工具时,返回结果缺少某个特定字段。原因:工作流中的工具输出映射配置不正确,或者mcp工具的实际输出与工作流预期的字段名不匹配。
怎么确认配好了
- 选取多个典型药物经济学政策文件进行知识库导入,检查分段后的内容是否保持语义完整性,尤其关注数值型字段与其描述的关联。
- 针对不同复杂度的政策文件,测试工作流的文件解析速度,确认不再出现解析超时错误。
- 通过 API 模拟调用工作流,检查
mcp工具的执行结果,验证所有预期字段均已正确返回且值符合预期。 - 设计包含多种查询意图(如查询报销比例、适用条件、更新日期)的测试用例,评估问答结果的准确性与完整性,并与原始政策文件进行对照。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。