这个品类的数据长什么样
焦煤尽调报告的数据主要来源于煤矿生产台账、港口质检报告、期货交割仓单及行业协会月度简报。生产台账每日更新,记录单批次焦煤的矿点、运输信息;质检报告随每批次货物出具,包含固定的质检指标;仓单与行业简报按周或月度更新。文档格式涵盖文本PDF、Excel台账与Word分析报告,核心字段包括批次号、灰分、硫分、挥发分、粘结指数、胶质层厚度,单位多为百分比、克/摩尔或毫米。
这些特征在「文档解析与分块」这一环带来什么约束
焦煤文档的结构化特征与多来源格式差异,对解析分块带来多重约束。不同来源的文档格式不统一,需适配文本PDF的段落分隔、Excel的行分隔与Word的表格结构。单批次数据的核心指标连续排布,若分块过长会引入无关内容,过短则会割裂指标关联。大文件(如月度全港口仓单)的解析需处理海量行数据,默认配置下易出现超时或合并分段的问题。部分文档的单位标识不统一,需在解析时保留字段与单位的对应关系,避免后续召回时的信息丢失。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
max_chunk_size | 800–1200 字符 | 焦煤尽调报告的核心指标字段多为单条数值+说明,该长度可覆盖单批次质检数据的完整描述 |
chunk_overlap | 50–100 字符 | 避免粘结指数、胶质层厚度这类连续指标被拆分在两个分段中 |
custom_delimiter | \n,批次号,矿点名称 | 匹配Excel台账的行分隔与焦煤文档的批次标识,避免跨行合并 |
UPLOAD_FILE_MAX_SIZE | 2000 MB | 适配单批次月度仓单类大文件的上传需求 |
PARSE_FILE_TIMEOUT_SECONDS | 1200 秒 | 大文件解析需较长时间,避免中途超时中断 |
similarity_threshold | 0.75 | 匹配焦煤质检指标的精确性要求,过滤低相关的非指标内容 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:10几M的Word文档解析后显示超时,后台日志返回
504 Gateway Timeout。原因:未调整PARSE_FILE_TIMEOUT_SECONDS参数,默认超时时间不足以完成大文件的全量解析。 - 现象:Excel导入后多批次数据被合并为一个分段,无法按单批次拆分。原因:未配置
custom_delimiter,使用默认通用分隔符,未匹配焦煤文档的批次标识与行分隔规则。 - 现象:与知识库chunk完全一致的焦煤质检内容无法被召回,新建相同配置的知识库后可正常召回。原因:首次导入时未正确设置
chunk_overlap参数,导致目标分段被截断,与原始内容存在细微差异。
怎么确认配好了
- 上传单批次10M以内的焦煤质检PDF,查看解析后的分段列表,确认每个分段包含完整的单批次质检指标。
- 导入包含多批次的Excel台账,检查每个分段对应一行数据,无跨行合并的情况。
- 上传大文件后查看解析进度,确认未在预设时间内出现超时提示。
- 输入已知的焦煤质检指标文本,验证可从知识库中召回对应分段。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。