这个品类的数据长什么样
煤化工研报的数据主要来自中国煤炭工业协会、各煤化工企业公开公告、第三方行业咨询机构的专项调研内容。更新节奏以月度供需报告、季度产能统计、年度产业规划为主,同时伴随煤炭价格波动、政策调整发布临时研报。文档结构多包含目录、结构化供需表格、工艺流程图、价格走势图表,内嵌excel格式的产能分布明细、pdf格式的政策附件。专业字段包含吨煤耗、产能万吨/年、销售价格元/吨等,部分文档附带单位标注的细分数据表格。
这些特征在「文档解析与分块」这一环带来什么约束
煤化工研报的结构化表格、内嵌图片与专业单位字段,对解析与分块环节提出多重约束。首先,文档中大量嵌入的工艺流程图、价格走势图无法通过纯文本解析完整传递信息,需同步提取图片资源并关联上下文。其次,专业字段与单位绑定紧密,分块时若强制拆分段落,会导致大模型无法识别“万吨/年”对应的具体产能主体。此外,长文档占比高,需避免分块边界破坏专业段落的完整性,同时适配不均的更新频率带来的文档体量差异。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PARSE_IMAGE_ENABLE | 开启 | 煤化工研报含工艺流程图、价格走势图,需提取图片并关联上下文 |
CHUNK_SIZE | 800–1200 字符 | 煤化工研报专业段落较长,避免拆分工艺参数或供需数据的完整表述 |
CHUNK_OVERLAP | 100–150 字符 | 保留专业字段与上下文的关联,避免分块后丢失单位与前文的对应关系 |
PARSE_EXCEL_IMAGE | 开启 | 部分煤化工研报附excel格式的产能统计表格,内嵌图片需单独解析 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 长文档研报解析耗时较长,避免超时中断 |
PARSE_TABLE_AS_MARKDOWN | 开启 | 保留研报中表格的结构化格式,便于大模型识别字段与单位 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 解析后excel内嵌图片字段为空,界面返回
400 BAD REQUEST报错。原因是未开启PARSE_EXCEL_IMAGE配置项,未提取excel中的内嵌图片资源。 - 分块后专业参数与单位拆分至不同块,导致大模型无法识别“万吨/年”对应的产能数据。原因是
CHUNK_OVERLAP取值过低,未保留上下文关联。 - 长文档解析超时,界面显示“解析失败”状态码
504 GATEWAY TIMEOUT。原因是PARSE_FILE_TIMEOUT_SECONDS设置低于实际解析耗时,未适配煤化工研报的长文本体量。
怎么确认配好了
- 上传单份煤化工研报的excel附件,检查解析结果中是否包含内嵌图片的关联文本说明。
- 查看分块后的文本片段,确认专业字段如“吨煤耗”“元/吨”与前后文未被强制拆分。
- 上传单份超过50页的研报pdf,等待解析完成后检查是否出现超时报错。
- 对比原始文档与解析后的markdown内容,确认表格结构未被扁平化处理为纯文本。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。