这个品类的数据长什么样
铁矿石智能尽调的数据主要来自矿山出具的质检报告、港口通关单据、大宗商品贸易合同及行业协会月度简报,随每批次货物的物流节点更新,行业简报为月度更新。文档以PDF格式为主,辅以Word贸易合同与Excel台账,结构包含固定表头的结构化表格与纯文本贸易条款。字段涵盖全铁干基含量、粒度分布区间、湿基水分、装运港信息等,粒度单位为毫米,含量类字段以干基或湿基为计量基准。
这些特征在「文档解析与分块」这一环带来什么约束
结构化表格占比高,若直接拆分纯文本会丢失含量、粒度等指标的列对应关系,需保留表格结构进行分块。每批次文档的专属字段(如批次号、产地)需绑定上下文,避免跨批次字段混淆。长文档多为月度行业简报,需按章节逻辑分块,不按固定长度拆分。多Sheet的Excel台账需按Sheet维度单独解析,避免跨Sheet内容混杂。PDF文档中的批注类备注需纳入解析范围,保障尽调信息完整性。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PARSE_TABLE_ENABLE | 开启 | 铁矿石尽调文档包含大量结构化表格,保留表格结构可保障含量、粒度等指标的列对应关系不丢失 |
PARSE_CHUNK_SIZE | 800–1200 字符 | 月度行业简报文档较长,该区间可兼顾单块信息完整性与检索召回精度,适配尽调报告的章节内容密度 |
PARSE_CHUNK_OVERLAP | 100–150 字符 | 避免跨章节关键信息被拆分,保障批次号、产地等专属字段的上下文连贯性 |
PARSE_EXCEL_SHEET_MODE | 按Sheet单独分块 | Excel台账多为不同批次的独立数据,按Sheet拆分可避免跨批次数据混杂 |
PARSE_PDF_ANNOTATION_ENABLE | 开启 | PDF文档中的贸易批注为尽调核心信息,需纳入解析内容 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 大型月度简报文档解析耗时较长,该时长可覆盖多数文档的解析需求 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:上传铁矿石质检PDF后,知识库搜索全铁含量相关内容无返回结果,界面显示解析成功但检索为空。原因:未开启
PARSE_TABLE_ENABLE配置,表格内容被直接转为无结构纯文本,导致关键词匹配失效。 - 现象:更新平台版本后,原miner-u解析入口消失,铁矿石文档无法正常解析。原因:平台已将miner-u解析功能整合至全局文件解析配置,需在知识库设置的「文档解析」模块中调整参数,不单独启用对应插件。
- 现象:上传Excel格式的铁矿石台账后,多Sheet数据被合并为单个分块。原因:未配置
PARSE_EXCEL_SHEET_MODE为按Sheet单独分块,导致跨Sheet数据混杂。
怎么确认配好了
- 上传单份铁矿石质检PDF,进入知识库的「文档解析日志」查看,确认表格结构被完整保留,无字段错位。
- 进入知识库设置的「文档解析」模块,核对
PARSE_TABLE_ENABLE、PARSE_EXCEL_SHEET_MODE等配置项的取值与预设方案一致。 - 发起知识库搜索测试,输入全铁含量、粒度分布等专属关键词,确认能召回对应文档的分块内容。
- 上传多Sheet的Excel台账,查看分块列表,确认每个Sheet对应独立的分块单元。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。