这个品类的数据长什么样
费用清单的数据来源于医疗机构的收费系统与保险公司的理赔受理系统,随单笔理赔申请同步提交。更新节奏为按需触发,仅当对应理赔单进入初审环节时生成并同步。文档多为结构化的表格形式,包含收费项目名称、医保编码、单价、数量、总价、收费科室、诊疗日期、统筹支付金额、个人自付金额等字段,金额字段单位统一为元,数量字段单位多为次、件或组。
这些特征在「知识库检索与召回」这一环带来什么约束
结构化的表格结构要求检索需保留字段关联,无法仅通过全文模糊匹配完成精准召回,需针对收费项目、编码等字段设置定向检索规则。按需更新的特性要求知识库支持增量同步,避免全量重传大量历史文件,降低检索效率。多字段与固定单位的要求,使得召回结果需完整保留字段与单位信息,防止解析后内容被打散导致字段关联丢失。同时,不同医疗机构的费用清单格式存在细微差异,需配置兼容多格式的解析规则,确保不同来源的清单均可被正确识别。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PARSE_FILE_TIMEOUT_SECONDS | 300 秒 | 费用清单文件体量较小但需匹配字段结构,避免解析过程超时中断 |
UPLOAD_FILE_MAX_SIZE | 10 MB | 单份费用清单多为1-3页文档,该取值可覆盖常规文件大小并限制异常大文件上传 |
召回条数 | 前 8 条 | 单笔理赔的费用清单通常包含10-20个收费项目,召回前8条可覆盖核心检索需求 |
相似度阈值 | 0.75–0.85 | 需区分相似收费项目编码与名称,该区间可平衡召回精准度与覆盖范围 |
metadata | 传递收费项目编码、理赔单号 | 方便后续关联理赔系统数据,快速定位对应费用规则与历史案例 |
分段长度 | 600–800 字符 | 费用清单的条目组长度适中,该分段长度可保留收费项目的上下文关联信息 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 调用创建文件集合接口传入
metadata参数后,返回的文件元数据字段为空。原因:未在知识库解析配置中启用元数据存储开关,导致传入参数未被持久化。 - 上传docx格式的费用清单后,RAG检索结果未包含正文所在的章节标题信息。原因:未开启文档解析时的章节标题提取配置,解析过程未抓取标题节点。
- 配置完成后AI回答仍包含知识库外的内容。原因:未启用回答严格限定配置,导致模型生成了未受知识库约束的内容。
怎么确认配好了
- 上传一份包含3-5个收费项目的测试费用清单文件,查看解析后的文本是否完整保留所有字段与对应单位。
- 调用知识库检索接口传入测试收费项目关键词,核对返回结果的条数与相似度是否符合配置的阈值区间。
- 查看文件集合详情页,确认
metadata参数对应的收费项目编码、理赔单号字段已正确显示在元数据栏中。 - 发起模拟理赔初审问答,验证回答内容仅围绕知识库内的费用规则与清单信息展开,未出现无关内容。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。