中药智能尽调报告的向量模型与索引

中药智能尽调报告的数据主要来源于国家药典标准文件、药企研发备案文档、中药材溯源流通数据、饮片质检报告四类。更新节奏分为定期与实时两类:药典标准随国家修订周期

这个品类的数据长什么样

中药智能尽调报告的数据主要来源于国家药典标准文件、药企研发备案文档、中药材溯源流通数据、饮片质检报告四类。更新节奏分为定期与实时两类:药典标准随国家修订周期更新,药企内部文档随研发批次更新,溯源数据随中药材流通环节实时更新。文档结构包含基原、性状、鉴别、含量测定、炮制方法、性味归经、功能主治等固定字段,部分文档附带批次号、生产日期、检测数值等附属信息,单位涵盖g、mg、ml、%等计量标准。

这些特征在「向量模型与索引」这一环带来什么约束

多字段结构化的文档内容,要求向量索引需按字段拆分存储,避免无关字段干扰语义相似度计算;含量测定的数值型字段需先完成归一化处理,否则不同单位的数值会导致向量嵌入偏差。实时更新的溯源数据,要求索引支持增量更新,若采用全量重建的方式,会占用大量计算资源。专业术语密集的文档内容,要求嵌入模型需适配中医药垂直领域,通用嵌入模型对专业术语的语义理解存在偏差,影响召回准确性。长文档的分段需保留术语完整性,避免拆分破坏专业表述的语义连贯性。

配置怎么定

配置项建议取法这样取的依据
chunk_size800–1200 字符适配中药文档的专业段落长度,避免拆分破坏术语完整性
chunk_overlap100–150 字符保留跨分段的专业术语上下文,避免索引断裂
embedding_model中医药垂直领域微调版m3e通用嵌入模型对中医药专业术语的语义匹配精度不足,垂直微调模型可提升召回准确性
vector_db_index_typeHNSW适配高维向量的快速召回,满足专业文档的实时查询需求
recall_top_k前8–12条覆盖中药文档的多字段关联信息,避免召回不足
similarity_threshold0.72–0.85过滤低相似度的无关文档,适配专业领域的语义匹配精度
incremental_index开启适配溯源数据的实时更新需求,减少全量重建的资源消耗

本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。

容易做错的三处

  • 界面显示m3e无可用频道报错,无法调用嵌入模型。原因是未完成m3e模型的节点配置,未在系统设置中添加对应接入频道。
  • 上传中药尽调报告文档后,向量索引列表无对应条目,任务状态显示超时。原因是chunk_size设置过大,超出嵌入模型的最大输入长度限制,导致嵌入任务超时。
  • 相同查询多次触发向量数据库请求,未复用结果。原因是未开启query_cache配置,或缓存有效期设置不合理,无法覆盖常规查询周期。

怎么确认配好了

  • 上传一份标准中药饮片质检报告,核对嵌入任务状态为完成,向量索引列表生成对应条目。
  • 输入中医药专业术语,查看召回结果包含文档的对应字段,无明显无关内容。
  • 连续发起两次相同查询,核对向量数据库日志仅记录一次请求(若开启缓存)。
  • 查看系统嵌入任务的资源占用,未出现过载情况。

问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。