这个品类的数据长什么样
这个品类的数据主要来自《中华人民共和国药典》、国家药品监督管理局备案的中药饮片与成药信息、药企官方发布的产品说明书、医保中药报销目录,以及电商渠道的商品详情页、用户评价标签。核心字段包含品名、性味归经、功能主治、用法用量、批准文号、生产企业、售价、库存与营销话术标签,其中「用法用量」带有克/次、克/日等固定单位,「批准文号」为固定格式的字符串。药典数据每5年修订一次,药企内部产品数据随新品上线更新,电商渠道数据每日同步。
这些特征在「模型接入与配置」这一环带来什么约束
不同来源的中药数据存在格式差异,需针对「性味归经」「用法用量」等带有固定格式的字段做校验,避免解析错误。权威备案数据与电商营销数据需分开存储与召回,防止非合规内容混入营销输出。电商渠道的实时同步要求接入的数据源支持增量拉取,否则会出现数据滞后。单份文档包含多组中药信息的场景,需要更长的解析超时时间与更大的文件上传限制。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
maxContext | 8000–12000 字符 | 覆盖单份中药备案文档、电商详情页的完整文本长度 |
UPLOAD_FILE_MAX_SIZE | 1800 MB | 适配批量中药产品手册、合规文档的批量上传需求 |
召回条数 | 前2条 | 匹配仅使用少量权威背景知识的需求,避免无关内容干扰 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 处理包含多组中药数据的长文档解析所需的合理超时时间 |
相似度阈值 | 0.82–0.88 | 过滤与中药营销主题无关的召回内容,确保合规性 |
MODEL_NAME | gpt-4o-mini | 适配社区反馈的主流推理模型,降低对接门槛 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:配置
召回条数为5条以上,返回的营销内容包含超出药典范围的功效描述。原因:未设置相似度阈值或阈值设置过低,引入了非权威的非合规营销内容。 - 现象:对接第三方推理框架时出现
400 Bad Request报错,日志显示invalid model name。原因:未将MODEL_NAME配置为框架支持的模型标识,或未正确配置推理接口的基础地址。 - 现象:同步电商平台数据后,部分中药的「用法用量」字段为空。原因:未对电商详情页的字段做格式校验,未映射正确的数据源字段,导致非标准化的单位文本无法被解析。
怎么确认配好了
- 上传一份单份中药产品说明书,检查解析后的字段是否包含「性味归经」「功能主治」等核心字段,且字段格式符合药典规范。
- 发起一次测试查询,输入「某中药的功能主治」,检查返回的背景知识召回条数是否符合配置的
召回条数。 - 查看推理服务的连接日志,确认
MODEL_NAME和接口地址配置正确,无invalid model name或connection timeout报错。 - 调整
相似度阈值,测试不同阈值下的召回内容,确认过滤效果符合预期。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。