这个品类的数据长什么样
焦煤研报数据主要来自煤炭行业协会公开报告、期货交易所交割标准文档、券商行业分析PDF、主产区及港口现货报价数据。更新节奏涵盖每日现货报价、每周行业库存周报、不定期深度分析报告。文档多为多页PDF格式,包含结构化数据表格与文字分析内容,结构化字段包含粘结指数、全水分、硫分、灰分、吨价等,单位多为%、元/吨、g/g等。
这些特征在「文档解析与分块」这一环带来什么约束
焦煤研报的结构化表格多、字段单位混杂且存在细分品级差异,要求解析环节精准提取单元格数据,避免跨行跨列的解析错误。不定期深度报告篇幅较长,需适配长文档分块规则,避免核心分析内容被截断。每日更新的现货报价数据时效性强,解析环节需支持增量处理,避免重复解析全量历史文档。不同品级焦煤的数据分散在不同章节,分块时需按品级聚类,提升后续检索的精准匹配度。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PARSE_CHUNK_SIZE | 800–1200 字符 | 焦煤研报包含长段分析与结构化表格,该区间可平衡内容完整性与检索精度,避免单块内容过碎或过长。 |
PARSE_CHUNK_OVERLAP | 100–150 字符 | 焦煤研报的分析内容常跨分块衔接,重叠设置可保留上下文关联,避免关键逻辑断裂。 |
PARSE_TABLE_EXTRACT_MODE | structured_only | 焦煤研报的结构化数据表格为核心检索内容,仅提取结构化表格可过滤冗余文字,提升检索精准度。 |
PARSE_INCREMENTAL_ENABLE | 开启 | 每日更新的现货报价数据占比高,增量解析可跳过已处理的历史文档,缩短解析耗时。 |
PARSE_TIMEOUT_SECONDS | 600 秒 | 部分深度焦煤研报篇幅较长,该超时设置可避免长文档解析被强制中断。 |
UPLOAD_FILE_MAX_SIZE | 1000 MB | 焦煤行业深度研报单文件体积可能较大,该设置可支持大文件上传解析。 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:上传焦煤研报PDF后,数据处理环节返回空内容,搜索测试无匹配结果。原因:未启用表格结构化提取配置,导致研报中的核心价格、库存表格数据未被正确解析入库。
- 现象:向量化任务耗时过长,系统响应延迟。原因:分块大小设置低于合理区间,单文档生成的分块数量过多,增加向量化计算负载。
- 现象:用户提问文本触发文档解析流程,占用解析资源。原因:未正确配置
QUERY_SKIP_PARSE参数,导致非文档类的提问内容被误加入解析环节。
怎么确认配好了
- 上传一份焦煤现货报价PDF,查看解析后的分块内容,确认表格数据被完整提取,单位与字段对应正确。
- 查看解析任务的日志,确认增量解析开关生效,仅新上传的文档被处理,历史文档未重复解析。
- 上传一份篇幅较长的焦煤深度研报,确认解析任务未触发超时错误,分块长度符合预设规则。
- 发起非文档类的用户提问,确认提问内容未触发解析流程,仅文档类内容进入解析环节。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。