这个品类的数据长什么样
动力煤智能尽调报告的数据来源包括煤矿企业生产台账、港口现货交割质检文档、行业供需简报及期货交割仓单。更新节奏随文档类型差异明显,现货交割文档随每批次交割实时更新,企业生产报表按月发布,行业简报按周更新。文档多为PDF或结构化表格格式,包含批次标识、核心质检指标、供需关联信息等字段。核心字段的单位包括千卡/千克(发热量)、质量分数(全水分、灰分、硫分)、吨(交割量)。
这些特征在「文档解析与分块」这一环带来什么约束
多来源的文档格式差异较大,既有纯文本的企业台账,也有带表格嵌套的PDF质检报告,需要适配不同格式的结构化提取逻辑。批次化的实时更新文档要求解析时保留批次与指标的关联关系,避免分块后丢失数据上下文。核心字段的单位与指标绑定紧密,分块时需将同批次的指标数据作为连续单元,防止跨批次的指标混淆。部分行业简报存在长段落的供需分析,需根据指标边界调整分块长度,避免将关联指标拆分至不同分块中。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PARSE_TABLE_ENABLE | 开启 | 动力煤尽调报告包含大量结构化表格数据,开启后可完整提取表格内的批次与指标信息 |
CHUNK_SIZE | 800–1200 字符 | 动力煤报告的核心指标批次关联紧密,该长度可保留单批次的完整指标组,避免拆分跨批次数据 |
PARSE_IGNORE_IMAGE | 关闭 | 部分质检报告附带采样图片,图片包含批次标识的辅助信息,不可忽略 |
UPLOAD_FILE_MAX_SIZE | 500 MB | 大型港口交割仓单合集的单文件尺寸通常不超过该值,可避免上传失败 |
PARSE_TIMEOUT_SECONDS | 300 秒 | 多页PDF质检报告的解析耗时通常在200秒以内,预留合理缓冲时间 |
CHUNK_OVERLAP | 10–15% | 保留批次指标的上下文关联,避免分块边界切断关联数据 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:上传修改后缀的结构化文档(如将HTML接口文档重命名为TXT)后,解析结果为空。原因:文档的结构化标记未被识别,重命名仅修改后缀名,未改变文档本身的格式结构,无法触发对应解析逻辑。
- 现象:使用
chunk模式调用pushdataAPI上传后,任务长期处于索引中状态。原因:分块参数设置过大,导致单分块内容超出系统处理阈值,或分块重叠率配置不合理,引发索引队列阻塞。 - 现象:上传包含质检采样图片的PDF文档后,解析结果中无图片关联信息。原因:
PARSE_IGNORE_IMAGE配置项被误开启,导致图片文本与辅助标识被过滤。
怎么确认配好了
- 上传一份单批次的动力煤质检PDF文档,查看解析结果中的表格提取完整性,核对核心字段是否完整提取。
- 调整
CHUNK_SIZE与CHUNK_OVERLAP参数后,查看分块预览界面,确认同批次的指标数据未被跨分块拆分。 - 查看上传任务的日志,确认解析超时时间配置大于实际解析耗时,无超时报错。
- 上传包含采样图片的质检文档,确认解析结果中包含图片的OCR提取内容。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。