这个品类的数据长什么样
合理用药制度的数据主要来源于国家卫生健康委员会、国家药监局发布的各类政策法规、技术指南、药品说明书、临床路径以及医院内部制定的药事管理制度、处方审核细则等。这些文档更新频率不一,政策法规可能每年更新,药品说明书随上市或修订随时更新,而院内制度则根据实际情况定期修订。文档结构通常为PDF或Word格式,包含大量非结构化文本,但也常有表格、列表等半结构化内容。字段方面,涉及药品通用名、商品名、适应症、禁忌症、用法用量、不良反应、相互作用、用药注意事项等,单位则包含毫克(mg)、毫升(ml)、天(天)、次(次)等,这些单位在不同文档中可能存在缩写或不同表述。
这些特征在「模型接入与配置」这一环带来什么约束
合理用药数据来源的权威性要求知识库召回的准确性极高,任何偏差都可能导致严重后果。多样的文档格式,尤其是PDF中的表格和图片,对文本提取和结构化提出了挑战,需要更强的数据预处理能力。药品信息更新的实时性,特别是新药上市或说明书修订,要求知识库能够快速更新并索引,以避免模型基于过时信息进行回答。此外,大量专业术语和计量单位的存在,要求模型在理解和生成时能准确识别和处理,避免因单位混淆导致用药错误。这些特征决定了在模型接入与配置时,需要特别关注文本分段策略、召回精度以及模型对专业知识的理解深度。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500–800 字符 | 兼顾上下文完整性与单段信息密度,避免过长导致模型处理效率下降或信息冗余。 |
分段重叠长度 | 50–100 字符 | 确保上下文衔接,减少因分段截断而丢失关键信息。 |
召回条数 | 前 8–12 条 | 合理增加召回数量,覆盖更多相关制度条款,提高准确性。 |
相似度阈值 | 0.75–0.85 | 在保证召回相关性的前提下,过滤掉低相关度的冗余信息。 |
最大上下文长度 | 4096 tokens | 适应医疗制度文档可能包含较长描述的特点,保证模型能处理完整上下文。 |
解析超时时间 | 600 秒 | 应对大型PDF文档解析可能耗时较长的情况,避免解析中断。 |
容易做错的三处
- 调用工具时出现“Tool call Parser error”:这通常发生在模型返回的工具调用格式不符合预期,例如
think标签未正确嵌套或字段名不匹配。 - 回答中出现剂量单位混淆或缺失:原因常是原始文档中单位表述不规范,或者文本分段时将剂量与单位分离,导致模型理解不完整。
- 无法接入某些第三方模型:这可能与API密钥配置错误、网络连接问题或模型接口协议不兼容有关。
怎么确认配好了
- 选取典型合理用药场景,例如“某药品在肾功能不全患者中的用法用量”,测试模型是否能准确引用相关制度条款并给出具体建议。
- 针对近期更新的药品说明书或政策文件,提问相关内容,验证知识库更新后模型是否能召回最新信息。
- 模拟用户提问中包含专业术语和缩写的情况,检查模型是否能正确理解并给出准确、专业的回答,同时核对回答中出现的剂量、频率等单位是否正确。
- 检查模型在处理多条相关制度交叉引用时,是否能有效整合信息并避免矛盾。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。