这个品类的数据长什么样
既往症判定的数据主要来源于理赔申请人提交的既往症告知书、医院门诊/住院病历、医保结算单据、既往核保记录。数据随单份理赔申请实时更新,单份文档可能包含结构化表格与非结构化文本混合内容。字段包含确诊病症名称、ICD-10编码、确诊时间、就诊医院、治疗费用等,时间字段采用YYYY-MM-DD格式,费用以人民币元为单位。
这些特征在「文档解析与分块」这一环带来什么约束
结构化与非结构化混合的文档结构,要求解析工具同时支持表格提取与自由文本抽取,避免遗漏结构化的病症清单信息。多且标准化的字段要求分块时保留字段间的关联关系,不能随意拆分跨字段的文本段落。实时更新的需求要求解析流程不能包含过长的预处理步骤,需适配快速提交的理赔场景。多样的文档来源要求解析工具兼容不同排版格式的PDF、Word、PPT等文件,避免因格式差异导致解析失败。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PARSE_FILE_TIMEOUT_SECONDS | 300 秒 | 既往症相关文档多包含长病历文本,常规超时时长不足以完成完整解析 |
CHUNK_SIZE | 800–1200 字符 | 既往症判定需保留病症与就诊时间、医院等关联信息,分块长度适配该关联需求 |
CHUNK_OVERLAP | 150–200 字符 | 保留跨块的病症关联上下文,避免拆分后丢失关键信息链 |
ENABLE_TABLE_EXTRACTION | 开启 | 既往症判定文档常包含结构化告知表格,提取表格可完整保留字段对应关系 |
ENCODING_AUTO_DETECT | 开启 | 适配多来源文档的编码格式,避免因固定编码导致解析报错 |
MAX_PARSE_FILE_SIZE | 50 MB | 覆盖单份理赔申请附带多份附件的常见文件大小上限 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象为解析文档时返回“the argument ‘windows-1252’ is invalid encoding”报错,原因是未开启
ENCODING_AUTO_DETECT,强制使用固定编码无法兼容非标准编码的上传文件。 - 现象为解析后的分块结果丢失ICD-10编码与对应病症的关联信息,原因是
CHUNK_SIZE设置过小,将包含完整关联的文本行拆分至不同分块中。 - 现象为工作流中调用文档解析工具后返回空结果,原因是未配置
CUSTOM_READ_FILE_URL环境变量,无法读取工作流上传的本地文件。
怎么确认配好了
- 上传一份包含结构化表格与非结构化文本的既往症告知书,查看解析结果中的表格提取完整性,确认配置生效。
- 查看解析日志中的编码检测记录,确认自动编码检测功能正常识别上传文档的编码格式。
- 在工作流中添加文档解析节点,上传测试文件并触发执行,确认返回的分块结果包含完整的病症、确诊时间等关联字段。
- 调整
CHUNK_SIZE参数后重新解析同一份测试文档,对比分块结果的字段完整性,确认配置可生效。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。