这个品类的数据长什么样
煤化工智能尽调报告的数据主要来自公开行业统计公报、煤炭加工企业年度披露文件、环评审批公示、产能核定报告。更新节奏分为两类:常规行业数据按季度或年度更新,单个项目的尽调文档仅在项目核准或投产时更新一次。文档结构多包含固定模块:项目基本信息、原料煤品质参数、生产工艺参数、产能规模、环保指标、财务测算摘要。部分文档附带结构化附表,包含连续的数值型字段,单位涉及万吨/年、立方米/小时、单位质量占比等。
这些特征在「文档解析与分块」这一环带来什么约束
煤化工尽调报告的多模块结构要求解析时精准识别章节边界,避免跨模块分块导致语义断裂。文档内包含大量数值型字段且单位多样,需保留字段与单位的对应关系,否则分块后无法还原完整业务信息。部分文档附带结构化附表,若解析时未保留表结构,会导致分散的数值数据无法关联。公开文档格式不统一,存在扫描件与加密内容的情况,增加解析环节的适配难度。不同文档的更新节奏差异,要求分块时同步保留关联的时间戳信息,确保后续检索的时效性匹配。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PARSE_MODE | auto | 适配煤化工尽调报告多样的PDF、Word格式,自动匹配合适的解析逻辑 |
CHUNK_SIZE | 800–1200 字符 | 覆盖长段落工艺描述与数值表格的完整语义,避免分块后业务逻辑断裂 |
CHUNK_OVERLAP | 100–150 字符 | 保留相邻分块的上下文关联,保障跨章节工艺信息的连贯性 |
PARSE_TABLE_ENABLE | true | 保留煤化工尽调报告中结构化附表的完整结构与字段对应关系 |
PARSE_SCAN_ENABLE | 按实测标定 | 适配部分扫描件格式的尽调文档,需结合实际文档的扫描质量调整 |
PARSE_FILE_TIMEOUT_SECONDS | 300 秒 | 适配长篇幅的尽调报告,保障多页附表的完整解析过程 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 上传修改后缀的非标准文档后无解析结果。原因是未启用对应非标准格式的解析适配,FastGPT通过文件后缀匹配解析逻辑,修改后缀无法触发正确的解析流程。
- 使用chunk模式调用pushdata API上传后长期显示索引中。原因是分块参数设置超出系统处理阈值,导致索引任务堆积,或未配置分块后的自动索引触发条件。
- 解析后的文档内容中缺失图片关联信息。原因是未启用图片解析配置,或文档中的图片为扫描件且未开启OCR解析开关。
怎么确认配好了
- 上传一份典型的煤化工尽调报告文档,查看解析后的文本内容,确认章节边界与字段单位的关联是否完整。
- 调用文档解析接口,检查返回的分块数据中是否保留了结构化附表的完整结构,验证表格解析配置是否生效。
- 查看任务执行日志,确认解析与分块过程未出现超时报错,验证超时参数的设置是否适配文档篇幅。
- 上传一份扫描件格式的尽调报告,确认OCR解析结果是否可正常读取,验证扫描解析配置是否正确。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。