这个品类的数据长什么样
中药智能尽调报告的数据来源包含《中华人民共和国药典》标准文档、中药材基原鉴定报告、饮片炮制工艺记录、批次溯源台账与第三方抽检数据。更新节奏分为两类:药典标准按固定周期更新,日常抽检与溯源数据按月同步。文档结构混合结构化与非结构化内容,结构化字段包含基原学名、炮制方法、浸出物含量、农药残留量等,对应单位为mg/g、mg/kg等;非结构化内容为长文本的炮制步骤说明与溯源说明文档。
这些特征在「部署与升级」这一环带来什么约束
混合结构化与非结构化的中药数据,要求部署时同时配置结构化解析与非结构化文本拆分的适配规则,避免长文本解析超时。严格的字段单位要求,需在解析环节保留原始单位,否则尽调报告的专业性失效。多周期的数据更新节奏,需要配置分层同步机制,区分药典标准库的大版本升级与日常抽检数据的增量同步,同时需避免新旧版本字段冲突导致的知识库异常。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 中药检验报告与药典文档通常篇幅较长,单文件解析耗时较长,避免超时中断解析流程 |
maxContext | 8000–12000 字符 | 中药炮制工艺与含量测定的详细说明属于长文本内容,需保留足够上下文以维持逻辑完整性 |
召回条数 | 前 8 条 | 中药尽调需覆盖基原、炮制、检验多维度数据,过少会遗漏关键信息,过多会引入冗余内容 |
相似度阈值 | 0.75–0.85 | 中药术语专业性较强,需较高匹配度避免无关饮片数据混入召回结果 |
UPLOAD_FILE_MAX_SIZE | 500 MB | 批量上传的药典扫描件与溯源台账文件体积较大,需放宽上传上限以支持批量导入 |
AIProxy_ENABLE | 开启 | 适配私有化部署场景下本地大模型的接入需求,确保模型调用路由正常 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:调用API仅返回模型回答,无引用文献细节。原因:未开启知识库的引用来源展示配置,且未设置足够的
召回条数以覆盖关联数据。 - 现象:模型渠道测试报错,但服务器部署状态显示正常。原因:未正确配置
AIProxy_ENABLE参数,本地大模型的接入路由未打通。 - 现象:解析后的中药数据丢失含量测定的单位字段。原因:未开启结构化数据保留原始单位的解析开关,导致字段标准化时丢失mg/g、mg/kg等关键单位。
怎么确认配好了
- 上传单份中药检验报告文件,检查解析后的结构化字段是否包含基原、浸出物含量、农药残留量等内容,确认单位未被自动清除。
- 调用测试接口,检查返回结果中是否包含引用来源字段,且字段内包含上传文件的文件名与对应段落位置。
- 查看服务器日志,确认
PARSE_FILE_TIMEOUT_SECONDS参数生效,大文件解析未出现超时报错。 - 配置定时同步任务后手动触发同步,检查新的药典标准数据是否自动更新至知识库中。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。