这个品类的数据长什么样
铁矿石投研相关数据主要来自国内现货交易平台公开数据、期货交易所交割仓单数据、矿山企业公开产能公告、钢铁企业采购台账、行业协会调研数据。更新节奏分为每日更新的现货价格数据、随交易时段更新的交割仓单数据、按月发布的行业调研数据、不定期发布的矿山与钢厂公告。文档类型包含结构化表格类的现货报价单、交割清单,半结构化的供需分析研报,以及非结构化的第三方质检报告。字段包含产地、干基含铁量数值、离岸价、到岸价、装卸港、交割批次等,单位多采用干吨、湿吨等大宗商品通用计量标准。
这些特征在「文档解析与分块」这一环带来什么约束
铁矿石投研文档的多类型特征对解析分块环节提出多重约束。结构化表格类文档包含多层级表头与多维度字段,需准确识别表头层级与数据列关联,避免字段错位或丢失。半结构化研报包含专业术语与跨章节的供需关联内容,分块时需保留术语完整性与上下文衔接。非结构化质检报告包含复杂的专业检测描述,需避免拆分核心检测术语与数据。不同更新频率的文档需匹配对应解析策略,确保高频更新的现货数据与低频发布的公告文档均可被准确处理。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PARSE_PDF_USE_MARKER | 开启 | 铁矿石相关文档多包含扫描版质检报告、研报PDF,marker的高精度OCR可准确识别表格与专业术语,规避OCR识别错误 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 大型铁矿石研报或多页质检报告解析耗时较长,600秒可覆盖多数长文档解析需求,适配私有化部署场景下的资源占用 |
CHUNK_SIZE | 800–1200 字符 | 铁矿石文档包含多维度字段与专业术语,该区间可保留单块内容的逻辑完整性,避免拆分跨字段的关联信息 |
CHUNK_OVERLAP | 10–15% | 分块重叠可保留跨块内容的上下文关联,适配铁矿石研报中供需数据与政策解读的衔接逻辑 |
EXCEL_PARSE_MODE | 保留完整表头与行列结构 | 铁矿石现货报价表、交割清单等Excel文档包含多层级表头与字段关联,该模式可避免字段错位或丢失 |
PARSE_TABLE_STRUCTURE | 开启 | 铁矿石文档中的结构化表格需保留行列关系,便于后续召回时的字段匹配 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:上传扫描版铁矿石质检报告或研报PDF时,界面返回
OCR Error报错,解析结果缺失专业术语与表格数据。原因:未开启PARSE_PDF_USE_MARKER配置,使用默认OCR引擎无法适配铁矿石专业术语与复杂表格结构。 - 现象:私有化部署场景下上传超过80页的铁矿石行业研报PDF,FastGPT返回
504 Gateway Timeout,解析服务日志显示解析成功但未同步至知识库。原因:PARSE_FILE_TIMEOUT_SECONDS配置取值低于实际解析耗时,未覆盖长文档处理周期。 - 现象:上传铁矿石现货报价Excel文件后,解析分块内容缺失产地、价格等核心字段,或字段错位混乱。原因:未将
EXCEL_PARSE_MODE设置为保留完整表头与行列结构,或CHUNK_OVERLAP取值过低,导致跨字段的关联内容被拆分。
怎么确认配好了
- 上传一份扫描版铁矿石质检报告PDF,查看解析结果是否包含完整的质检指标与表格结构,确认
PARSE_PDF_USE_MARKER配置生效。 - 上传一份100页以上的铁矿石研报PDF,等待解析完成后检查任务状态,确认
PARSE_FILE_TIMEOUT_SECONDS取值适配当前文档长度。 - 上传一份铁矿石现货报价Excel文件,查看解析后的分块内容是否保留完整表头与字段关联,确认
EXCEL_PARSE_MODE与PARSE_TABLE_STRUCTURE配置正确。 - 调用知识库召回功能,输入铁矿石专业术语,检查召回的分块内容是否包含对应术语与关联信息,确认
CHUNK_SIZE与CHUNK_OVERLAP配置合理。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。