这个品类的数据长什么样
费用清单数据来源于医疗机构出具的收费单据、保险公司理赔系统导出的理赔附件,随单起理赔案件实时更新。单份文档对应单个理赔案件,结构固定,顶部包含就诊机构、就诊日期、患者信息表头,主体为收费明细行,包含项目名称、数量、单价、金额、医保类型字段,底部标注总费用、统筹支付、自费金额。字段单位多为人民币元、次数、天数,部分项目附带医保报销比例标注。
这些特征在「文档解析与分块」这一环带来什么约束
费用清单的实时绑定属性要求解析流程关联对应理赔案件ID,避免跨案件数据混淆。固定的结构化表头与明细行结构,要求解析时识别表头锚点,防止不同案件的单据混排。多字段且带单位的明细行,要求分块保留字段关联关系,不能拆分单条明细的完整信息。医保类型、统筹支付等关联字段,要求分块单元包含同一条明细的全部关联内容,避免拆分后无法还原报销逻辑。单份文档长度差异较大,建议按自有样本统计或实测后确定,需控制分块粒度,防止明细行与总计栏拆分。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PARSE_FILE_TIMEOUT_SECONDS | 300 秒 | 费用清单为结构化单据,解析耗时稳定在3分钟内,避免超时中断流程 |
chunk_size | 800–1200 字符 | 单条费用明细约50-100字符,该区间可容纳10-20条完整明细,保留字段关联关系 |
chunk_overlap | 150–200 字符 | 明细行存在跨块关联的医保类型、金额字段,重叠部分可保留上下文关联 |
UPLOAD_FILE_MAX_SIZE | 20 MB | 单份费用清单PDF多在10MB以内,预留合理上传余量 |
enable_table_parse | 开启 | 费用清单为结构化表格,开启后可准确提取字段与明细行内容 |
PARSE_MODEL | 按实测标定 | 结构化单据解析需兼顾格式识别与字段提取,需匹配支持表格解析的模型 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:使用
marker_images:v0.1镜像部署时出现容器启动报错,或本地部署4.8.12版本时无法解析费用清单中的医保比例公式。原因:marker_images版本与FastGPT版本不匹配,低版本模型对结构化单据中的公式类字段解析支持不足。 - 现象:上传费用清单PDF后,点击分块预览返回「无法读取该文件内容」报错。原因:PDF存在加密图层、扫描版无文本层,或文件大小超出
UPLOAD_FILE_MAX_SIZE配置阈值。 - 现象:费用清单解析后的分块结果中,单条明细的金额与医保类型字段分离。原因:
chunk_overlap配置取值过小,未保留跨块的字段关联上下文。
怎么确认配好了
- 上传单份费用清单文档,查看解析任务是否在
PARSE_FILE_TIMEOUT_SECONDS配置的时长内完成。 - 点击分块预览功能,检查单条费用明细的全部关联字段是否完整显示在同一个分块单元内。
- 对比不同解析模型的解析结果,确认费用清单中的医保类型、金额字段提取符合业务预期。
- 上传通过外部知识库同步的费用清单附件,检查解析后是否保留完整的明细行结构。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。