这个品类的数据长什么样
该品类的数据主要来自保险理赔案件的用户上传材料与内部工单台账,更新节奏随案件进度实时调整,单次案件可能包含多轮补件。身份类文档多为固定版式的身份证、社保卡等证件照片或结构化身份证明文件,包含姓名、身份证号、签发日期、有效期等字段,字段格式多为标准文本与日期格式。时效类文档多为表格形式的报案记录、出险证明、材料提交台账,包含报案时间、出险时间、材料提交时间、审核截止时间等字段,单位以日期、时间点及时长为主。
这些特征在「文档解析与分块」这一环带来什么约束
身份类文档多为图片格式,需通过OCR精准提取敏感字段,通用OCR的模糊识别可能导致核心信息丢失。时效类文档多为结构化表格,需保留时间节点与对应事件的关联关系,不能随意拆分单元格内容。多轮补件的特性要求解析支持增量匹配,避免重复处理已解析材料。敏感字段的存在要求分块后同步标记脱敏位置,防止敏感信息泄露。不同格式的材料需适配不同解析逻辑,统一分块规则需兼顾各类文档的结构特征。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PARSE_OCR_ENABLE | 开启 | 身份类理赔材料多为图片格式,需通过OCR提取结构化文本 |
maxChunkSize | 800–1200 字符 | 适配该品类文档的短段落与表格字段长度,避免分块破坏时间节点关联性 |
PARSE_FILE_TIMEOUT_SECONDS | 120 秒 | 多证件OCR与Excel台账解析耗时较长,防止中途超时中断 |
CHUNK_OVERLAP_RATE | 15% | 保留时效字段的上下文关联,避免跨块丢失报案、出险等时间对应关系 |
UPLOAD_FILE_MAX_SIZE | 50 MB | 适配高清证件照、Excel理赔台账的常见文件大小上限 |
PARSE_EXCEL_ENABLE | 开启 | 时效类数据常以Excel台账形式提交,需解析表格内的时间节点字段 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 上传Excel格式的时效台账后解析结果仅返回表头,无具体数据。原因是未开启
PARSE_EXCEL_ENABLE配置项,未启用Excel表格解析功能。 - OCR解析身份证照片后未提取到身份证号字段。原因是未通过
PARSE_OCR_DETECT_FIELDS配置指定提取身份证号等核心身份字段,默认解析未覆盖目标内容。 - 解析多份补件材料时出现
504 Gateway Timeout超时报错。原因是未调整PARSE_FILE_TIMEOUT_SECONDS配置,默认超时时长不足以完成多图片OCR解析。
怎么确认配好了
- 上传单张标准身份证照片,查看知识库解析结果中是否包含预设的身份字段,验证
PARSE_OCR_DETECT_FIELDS配置是否生效。 - 上传测试用Excel时效台账文件,查看解析结果是否完整提取表格内的时间节点与对应事件,验证
PARSE_EXCEL_ENABLE配置是否开启。 - 上传包含多份补件材料的压缩包,确认解析任务未出现
504超时报错,验证PARSE_FILE_TIMEOUT_SECONDS配置是否合理。 - 随机抽取一个分块,查看相邻分块是否保留了时效字段的上下文关联,验证
CHUNK_OVERLAP_RATE配置的作用。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。