这个品类的数据长什么样
焦煤相关数据主要来自国内煤炭工业协会发布的行业报告、期货交易所交割仓单数据、矿山企业公开的生产运营文档、港口通关台账及政策监管文件。数据更新节奏覆盖日度(港口库存、现货价格)、周度(产量、运力数据)、月度(供需平衡表)及年度(产业规划)。文档形态包含结构化表格、长文本分析报告、政策条文,核心字段包括全水含量、灰分、硫分、粘结指数、胶质层厚度,对应单位多为百分比、毫米、克每立方厘米。
这些特征在「文档解析与分块」这一环带来什么约束
焦煤数据的多时间粒度特性,要求解析环节保留文档附带的时间戳信息,避免不同周期的数据块被混淆。结构化表格包含专用行业字段,解析时需精准识别全水含量、粘结指数等专有列名,避免通用解析规则导致字段错位。长文本分析与表格混排的文档结构,要求分块时保留表格与上下文的关联,避免拆分后丢失业务逻辑。政策类文档的层级化结构,需按章节标题划分分块边界,确保同主题内容被聚合为独立块。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PARSE_TABLE_STRICT_MODE | 开启 | 焦煤文档表格包含专用行业字段,严格模式可精准识别列名,避免通用解析规则导致字段错位 |
CHUNK_MAX_SIZE | 800–1200 字符 | 适配焦煤研报的单段分析与表格关联内容长度,避免拆分后丢失业务上下文 |
CHUNK_OVERLAP_RATE | 10–15% | 保留分块间的上下文关联,确保跨块检索时可获取完整业务逻辑 |
UPLOAD_FILE_MAX_SIZE | 2000 MB | 支持大型行业研报、历史数据合集的上传需求 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 适配大型文档的解析耗时,避免因超时中断解析流程 |
ENABLE_TABLE_AS_SINGLE_CHUNK | 开启 | 确保焦煤文档中的结构化表格作为独立分块,避免与前后文本拆分后破坏核心业务数据的完整性 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:上传本地文件后解析节点无日志输出,任务长期处于待处理状态。原因:未配置
PARSE_FILE_TIMEOUT_SECONDS为适配焦煤大型文档的取值,或部署环境资源不足导致解析进程阻塞,针对Docker部署4.8.21版本,需确认MongoDB连接参数未设置过短。 - 现象:上传包含焦煤专用字段的表格文件后,仅抓取到部分列数据。原因:未开启
PARSE_TABLE_STRICT_MODE,通用解析规则无法识别粘结指数、胶质层厚度等专有字段,导致部分列被过滤。 - 现象:检索返回的Markdown格式焦煤供需表格被截断,显示
...[hide X char]。原因:CHUNK_MAX_SIZE取值过小,导致表格内容被拆分截断,或未开启ENABLE_TABLE_AS_SINGLE_CHUNK配置。
怎么确认配好了
- 上传包含焦煤专用行业字段的结构化表格文件,核对解析后的数据块完整保留所有列名与对应内容。
- 上传混排了长文本分析与表格的焦煤研报文档,核对分块结果中表格作为独立单元存在,未与前后文本拆分。
- 查看部署日志,确认解析进程未出现超时或慢操作相关报错,任务可正常完成。
- 测试检索功能,确认焦煤专用字段可被精准匹配并召回相关分块内容。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。