这个品类的数据长什么样
中药智能尽调报告的数据主要来源于国家药典标准文件、药企研发备案文档、中药材溯源流通数据、饮片质检报告四类。更新节奏分为定期与实时两类:药典标准随国家修订周期更新,药企内部文档随研发批次更新,溯源数据随中药材流通环节实时更新。文档结构包含基原、性状、鉴别、含量测定、炮制方法、性味归经、功能主治等固定字段,部分文档附带批次号、生产日期、检测数值等附属信息,单位涵盖g、mg、ml、%等计量标准。
这些特征在「向量模型与索引」这一环带来什么约束
多字段结构化的文档内容,要求向量索引需按字段拆分存储,避免无关字段干扰语义相似度计算;含量测定的数值型字段需先完成归一化处理,否则不同单位的数值会导致向量嵌入偏差。实时更新的溯源数据,要求索引支持增量更新,若采用全量重建的方式,会占用大量计算资源。专业术语密集的文档内容,要求嵌入模型需适配中医药垂直领域,通用嵌入模型对专业术语的语义理解存在偏差,影响召回准确性。长文档的分段需保留术语完整性,避免拆分破坏专业表述的语义连贯性。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
chunk_size | 800–1200 字符 | 适配中药文档的专业段落长度,避免拆分破坏术语完整性 |
chunk_overlap | 100–150 字符 | 保留跨分段的专业术语上下文,避免索引断裂 |
embedding_model | 中医药垂直领域微调版m3e | 通用嵌入模型对中医药专业术语的语义匹配精度不足,垂直微调模型可提升召回准确性 |
vector_db_index_type | HNSW | 适配高维向量的快速召回,满足专业文档的实时查询需求 |
recall_top_k | 前8–12条 | 覆盖中药文档的多字段关联信息,避免召回不足 |
similarity_threshold | 0.72–0.85 | 过滤低相似度的无关文档,适配专业领域的语义匹配精度 |
incremental_index | 开启 | 适配溯源数据的实时更新需求,减少全量重建的资源消耗 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 界面显示
m3e无可用频道报错,无法调用嵌入模型。原因是未完成m3e模型的节点配置,未在系统设置中添加对应接入频道。 - 上传中药尽调报告文档后,向量索引列表无对应条目,任务状态显示
超时。原因是chunk_size设置过大,超出嵌入模型的最大输入长度限制,导致嵌入任务超时。 - 相同查询多次触发向量数据库请求,未复用结果。原因是未开启
query_cache配置,或缓存有效期设置不合理,无法覆盖常规查询周期。
怎么确认配好了
- 上传一份标准中药饮片质检报告,核对嵌入任务状态为
完成,向量索引列表生成对应条目。 - 输入中医药专业术语,查看召回结果包含文档的对应字段,无明显无关内容。
- 连续发起两次相同查询,核对向量数据库日志仅记录一次请求(若开启缓存)。
- 查看系统嵌入任务的资源占用,未出现过载情况。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。