这个品类的数据长什么样
中药尽调的数据来源包括国家药品标准、地方炮制规范、产地溯源档案、批次检测报告等,多用于金融机构中药材供应链尽调、保险机构药材理赔核验等场景。标准类文档多为结构化格式,包含品名、基原、产地、炮制方法、性味归经、用法用量等字段,部分字段附带专属单位,如炮制规格标注“片/段/粉”,检测项标注“mg/kg”等。产地溯源文档随采收批次更新,批次检测报告多为附件形式附带于主文档中。
这些特征在「引用来源与溯源」这一环带来什么约束
中药品类的数据来源分散,金融或保险尽调场景下需确保引用的合规性可追溯,要求引用溯源支持多源数据关联。单份文档包含带专属单位的结构化字段,需确保召回时完整保留字段与单位信息,避免影响尽调判断。部分文档附带批次检测附件,需支持附件级别的溯源跳转。官方标准类数据按固定周期更新,需配套增量索引更新机制,避免引用过期内容。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
召回条数 | 前8-12条 | 中药尽调数据字段多且专业,过多召回会引入无关内容,过少则无法覆盖完整合规信息 |
相似度阈值 | 0.75-0.85 | 中药术语专业性强,需保留足够匹配度的精准内容,避免低匹配度的无关标准混入 |
PARSE_FILE_TIMEOUT_SECONDS | 120 秒 | 部分批次检测报告文档较长,解析耗时较长,默认参数可能无法完成解析 |
分段长度 | 600-800 字符 | 中药文档多为结构化字段组合,分段过长会丢失字段关联性,过短则破坏专业术语完整性 |
启用附件溯源 | 开启 | 部分尽调报告需关联批次检测附件,开启后可实现附件级别的溯源跳转 |
增量更新触发条件 | 按文件更新时间 | 中药标准类数据按官方发布周期更新,按更新时间触发可确保索引与源数据同步 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:引用源数据时仅展示片段内容,无法输出完整的源数据原文。原因:未配置合适的分段长度,导致专业术语或结构化字段被截断,无法完整匹配原文内容。
- 现象:索引任务长时间卡住无响应。原因:未调整
PARSE_FILE_TIMEOUT_SECONDS参数,长文档检测报告解析超时未触发重试机制。 - 现象:召回结果包含非目标品类的药材信息。原因:相似度阈值设置过低,引入低匹配度的无关标准数据,干扰尽调判断。
怎么确认配好了
- 上传单份中药标准文档,检查解析后的数据字段是否完整保留专属单位与结构化内容。
- 发起针对单一药材的尽调查询,确认返回结果中附带源数据的具体来源标识。
- 测试批量更新索引,确认仅更新修改后的文档,未触发全量重新索引。
- 验证附件上传功能,确认查询结果可跳转至对应批次检测报告的源文件。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。