这个品类的数据长什么样
既往症判定的数据主要来源于参保人员的医保结算明细、既往就诊病历、体检报告及门诊处方。数据更新节奏随单次理赔流程触发同步,或按固定周期更新区域医保库。文档同时包含结构化字段与非结构化文本,结构化字段包含就诊日期、ICD-10诊断编码、就诊机构名称、参保状态,单位对应为YYYY-MM-DD格式的日期、标准诊断编码字符串、机构名称文本、参保状态枚举值,非结构化部分为病历详情与医嘱内容。
这些特征在「引用来源与溯源」这一环带来什么约束
多源异构的数据结构要求溯源环节需同时支持结构化字段与非结构化文本的精准定位。ICD-10诊断编码的唯一性特征,要求溯源需关联对应诊断的具体就诊单据编号,不能仅返回文档名称。参保人维度的数据绑定需求,使得溯源需额外校验关联的参保人ID与就诊批次,避免跨用户数据泄露或混淆。同时,非结构化病历的长文本特征,要求溯源需定位到具体段落,不能仅返回整段文档。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
召回条数 | 前8-12条 | 既往症判定需覆盖参保人近3-5年的就诊记录,过多召回会增加上下文压力,过少则可能遗漏关键既往症数据。 |
相似度阈值 | 0.75-0.85 | 结构化诊断编码需精准匹配,非结构化病历文本需匹配语义关联,该区间可平衡召回精度与召回覆盖率。 |
PARSE_FILE_TIMEOUT_SECONDS | 120 秒 | 病历文档可能包含多页长文本,需足够时间完成切片与解析,避免超时导致解析失败。 |
分段长度 | 800-1000 字符 | 既往症判定的关键信息多集中在就诊日期、诊断、费用三个模块,该分段长度可保留模块完整性,避免切片割裂关键信息。 |
引用展示格式 | 结构化字段+非结构化片段 | 既往症判定需同时展示诊断编码对应的就诊记录与病历详情,该格式可清晰呈现溯源依据。 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:调用知识库问答API返回的回答中未携带引用片段字段,界面展示也无引用入口。原因:未开启FastGPT知识库的「返回引用详情」配置项,或调用API时未将
withReference参数设置为true。 - 现象:召回的引用片段包含非当前理赔参保人的就诊记录,出现数据混淆。原因:未在召回规则中添加参保人ID的过滤条件,导致跨用户的既往症数据被召回。
- 现象:长病历文档解析失败,控制台返回
504 Gateway Timeout错误。原因:设置的PARSE_FILE_TIMEOUT_SECONDS取值小于长文本病历的解析耗时,导致文档未完成切片即被终止。
怎么确认配好了
- 调用携带
withReference=true参数的知识库问答API,检查返回结果中是否包含references字段,且字段内包含就诊日期、诊断编码等既往症相关信息。 - 在FastGPT的知识库测试面板输入既往症判定相关查询,查看回复区域是否展示结构化字段与非结构化片段的溯源详情。
- 上传一份包含多页内容的病历文档,确认解析任务状态显示为「已完成」,无超时或解析失败的报错提示。
- 输入绑定其他参保人ID的查询请求,确认召回结果未返回非目标参保人的就诊记录。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。