铁矿石智能尽调报告的文档解析与分块

铁矿石智能尽调的数据主要来自矿山出具的质检报告、港口通关单据、大宗商品贸易合同及行业协会月度简报,随每批次货物的物流节点更新,行业简报为月度更新。文档以PD

这个品类的数据长什么样

铁矿石智能尽调的数据主要来自矿山出具的质检报告、港口通关单据、大宗商品贸易合同及行业协会月度简报,随每批次货物的物流节点更新,行业简报为月度更新。文档以PDF格式为主,辅以Word贸易合同与Excel台账,结构包含固定表头的结构化表格与纯文本贸易条款。字段涵盖全铁干基含量、粒度分布区间、湿基水分、装运港信息等,粒度单位为毫米,含量类字段以干基或湿基为计量基准。

这些特征在「文档解析与分块」这一环带来什么约束

结构化表格占比高,若直接拆分纯文本会丢失含量、粒度等指标的列对应关系,需保留表格结构进行分块。每批次文档的专属字段(如批次号、产地)需绑定上下文,避免跨批次字段混淆。长文档多为月度行业简报,需按章节逻辑分块,不按固定长度拆分。多Sheet的Excel台账需按Sheet维度单独解析,避免跨Sheet内容混杂。PDF文档中的批注类备注需纳入解析范围,保障尽调信息完整性。

配置怎么定

配置项建议取法这样取的依据
PARSE_TABLE_ENABLE开启铁矿石尽调文档包含大量结构化表格,保留表格结构可保障含量、粒度等指标的列对应关系不丢失
PARSE_CHUNK_SIZE800–1200 字符月度行业简报文档较长,该区间可兼顾单块信息完整性与检索召回精度,适配尽调报告的章节内容密度
PARSE_CHUNK_OVERLAP100–150 字符避免跨章节关键信息被拆分,保障批次号、产地等专属字段的上下文连贯性
PARSE_EXCEL_SHEET_MODE按Sheet单独分块Excel台账多为不同批次的独立数据,按Sheet拆分可避免跨批次数据混杂
PARSE_PDF_ANNOTATION_ENABLE开启PDF文档中的贸易批注为尽调核心信息,需纳入解析内容
PARSE_FILE_TIMEOUT_SECONDS600 秒大型月度简报文档解析耗时较长,该时长可覆盖多数文档的解析需求

本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。

容易做错的三处

  • 现象:上传铁矿石质检PDF后,知识库搜索全铁含量相关内容无返回结果,界面显示解析成功但检索为空。原因:未开启PARSE_TABLE_ENABLE配置,表格内容被直接转为无结构纯文本,导致关键词匹配失效。
  • 现象:更新平台版本后,原miner-u解析入口消失,铁矿石文档无法正常解析。原因:平台已将miner-u解析功能整合至全局文件解析配置,需在知识库设置的「文档解析」模块中调整参数,不单独启用对应插件。
  • 现象:上传Excel格式的铁矿石台账后,多Sheet数据被合并为单个分块。原因:未配置PARSE_EXCEL_SHEET_MODE为按Sheet单独分块,导致跨Sheet数据混杂。

怎么确认配好了

  • 上传单份铁矿石质检PDF,进入知识库的「文档解析日志」查看,确认表格结构被完整保留,无字段错位。
  • 进入知识库设置的「文档解析」模块,核对PARSE_TABLE_ENABLE、PARSE_EXCEL_SHEET_MODE等配置项的取值与预设方案一致。
  • 发起知识库搜索测试,输入全铁含量、粒度分布等专属关键词,确认能召回对应文档的分块内容。
  • 上传多Sheet的Excel台账,查看分块列表,确认每个Sheet对应独立的分块单元。

问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。