这个品类的数据长什么样
数据来源包括《中华人民共和国药典》各版、各省中药炮制规范、中药饮片质量标准、公开临床研究文献及药企出厂检验报告。更新节奏为国家药典每5年一次修订,地方规范每年发布增补公告。单份文档为单品种完整档案,结构包含基原、性味归经、功能主治、炮制方法、用法用量、质量检测项等字段,质量检测项多采用mg/kg、g/100g等单位,用法用量以克、毫升为单位。
这些特征在「知识库检索与召回」这一环带来什么约束
中药品类的数据源权威性强但更新周期固定,要求知识库需按周期同步新版药典及地方规范,避免使用过时合规数据。单份文档结构完整且篇幅较长,包含专业检测字段与单位,要求检索召回需保留字段关联上下文,避免分段切割破坏专业信息完整性。多源数据格式差异较大,需统一解析后的字段映射规则,确保不同来源的中药合规性、质量数据可被精准匹配检索。同时尽调场景需覆盖全维度合规信息,要求召回结果需覆盖核心字段。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PARSE_CHUNK_SIZE | 800–1200 字符 | 适配中药文档包含长段炮制方法与质量检测说明的特性,避免拆分专业术语或丢失上下文 |
RECALL_TOP_K | 前8–12 条 | 覆盖多来源的同一品种合规数据,避免冗余或遗漏核心尽调信息 |
SIMILARITY_THRESHOLD | 0.75–0.85 | 平衡专业术语精准匹配与多源数据召回需求,适配中药领域术语的多样化表述 |
UPLOAD_FILE_MAX_SIZE | 500 MB | 允许批量上传多版药典、地方规范等大型合集文档 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 为多页扫描文档或大型合规档案的解析预留足够时间 |
WORKFLOW_API_TIMEOUT | 120 秒 | 匹配嵌套知识库助手的多轮检索与解析流程,避免提前超时返回空值 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 调用工作流API时返回空值,原因是未使用v4.8.10及以上版本,或超时时间设置过短导致检索流程未完成。
- 知识库变量引用时报错“quote type error”,原因是未按要求使用双引号包裹变量参数,或变量包含未转义的特殊字符。
- 检索结果条数与配置不符,原因是未正确联动设置
RECALL_TOP_K与SIMILARITY_THRESHOLD,或分段切割时丢失了检索关键词所在的上下文片段。
怎么确认配好了
- 上传单份中药品种的标准文档,检查解析后的字段是否覆盖尽调所需的核心内容,确认分段未拆分专业检测术语与用法用量说明。
- 输入专业检索词发起测试,核对返回结果的字段完整性与来源覆盖度,确认符合场景需求。
- 测试变量引用与API调用流程,确认无格式报错或空值返回,匹配配置的超时与召回规则。
- 定期同步新版药典与地方规范数据,确认知识库更新流程正常触发,无数据滞后问题。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。