这个品类的数据长什么样
既往症判定的数据源主要来自脱敏的保险理赔历史案件档案、医保既往就诊记录、官方医学诊断标准文档(如ICD-10编码手册)。数据随新理赔案件提交按月同步更新。单条数据文档包含案件唯一标识、被保人脱敏身份信息、既往病史条目列表、单次诊断时间、就诊医院等级、对应ICD-10编码、理赔申请时间、核赔判定结果等字段。字段单位包括诊断时间采用ISO 8601日期格式,医院等级采用三级/二级/一级分级表述,金额字段以人民币元为单位。
这些特征在「知识库检索与召回」这一环带来什么约束
数据源包含脱敏的个人敏感信息,要求检索过程自动过滤被保人身份等字段,避免隐私泄露。按月更新的数据源节奏,要求知识库支持增量同步拉取,减少全量索引重建的资源开销。数据内包含多维度关联字段(如诊断时间、ICD-10编码),要求支持多条件联合检索,提升匹配精准度。单条数据内存在多个独立的既往病史条目,要求分块粒度对应单个病史条目,避免跨条目信息混淆。医学术语的标准化要求,需支持术语编码关联匹配,覆盖同义词与别名场景。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
召回条数 | 前8-12条 | 既往症判定需覆盖多维度既往病史记录,该取值可平衡信息完整性与上下文长度限制 |
相似度阈值 | 0.75-0.85 | 医学术语匹配需较高精准度,避免低相关的既往症记录干扰判定结果 |
分段长度 | 800-1200字符 | 单条既往病史条目包含诊断信息、时间、编码等内容,该长度可完整覆盖单一条目且避免跨条目分块 |
PARSE_FILE_TIMEOUT_SECONDS | 120秒 | 医学文档解析包含术语编码映射与脱敏处理,耗时较长,避免解析超时中断 |
增量同步触发方式 | 按更新时间增量拉取 | 数据源按月同步更新,增量拉取可减少全量索引重建的资源开销 |
重排返回条数 | 前5条 | 理赔初审环节无需过多结果,聚焦高相关的既往症记录以提升效率 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:外部调用检索接口或工作流内绑定知识库ID后,无任何搜索结果返回。原因:传入的知识库ID未绑定当前工作流的权限范围,或未正确获取对应知识库的有效ID,或知识库未完成全量索引构建。
- 现象:调用知识库上传接口时,返回
Invalid URL, code: 500错误。原因:传入的文件源URL存在格式错误或无法被系统正常拉取,导致解析流程中断。 - 现象:检索结果仅匹配到主要内容,未关联辅助数据字段的信息。原因:未配置启用辅助数据的检索匹配规则,仅针对分块的主要内容进行召回。
怎么确认配好了
- 调用知识库检索接口,传入测试用的既往症关键词,检查返回结果的条数是否符合配置的召回条数范围。
- 查看知识库索引日志,确认增量同步任务按预设的更新时间触发,无异常中断记录。
- 上传单条既往症文档,检查分块结果是否对应单个病史条目,无跨条目分块情况。
- 调用接口验证辅助数据的匹配功能,确认配置的辅助字段可被正常检索召回。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。