这个品类的数据长什么样
焦炭财报相关数据主要来自上市焦化企业的年度、半年度、季度报告,以及中国炼焦行业协会发布的行业运行简报。更新节奏为企业财报按季度、年度发布,行业简报按月度更新。文档结构方面,企业财报中焦炭相关内容多集中在主营业务分产品板块、产能与产能说明、成本构成、销售价格波动分析章节,部分附原材料采购量、下游关联行业数据。字段包含焦炭产量、产能、单位生产成本、平均销售单价、库存总量等,单位多为万吨、元/吨、万元。
这些特征在「文档解析与分块」这一环带来什么约束
多来源的文档类型带来解析适配压力,既有可编辑的Word导出PDF,也有扫描版行业简报,需适配不同解析逻辑。固定长度分块无法适配焦炭财报的混合结构:结构化表格需保留单元格关联,长文本分析需按主题拆分,否则会破坏业务逻辑。字段与单位的多样性要求解析时需关联上下文,避免将不同报告期的产量数据与错误单位绑定。高频更新的文档要求解析流程具备较高效率,避免因分块规则不合理导致处理耗时过长。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
chunk_size | 800–1200 字符 | 焦炭财报包含结构化表格与长文本分析,该区间可保留单块内的字段关联与主题完整性,避免拆分破坏业务逻辑 |
chunk_overlap | 80–120 字符 | 平衡上下文连贯性与存储效率,避免跨块的字段(如季度产量与对应单价)丢失关联 |
parse_mode | auto | 自动适配可编辑文本与扫描件,覆盖企业财报PDF、行业简报扫描版等多类型文档 |
enable_table_parse | 开启 | 焦炭财报中存在大量分产品产量、成本表格,启用后可保留表格结构,避免解析为混乱的纯文本 |
PARSE_FILE_TIMEOUT_SECONDS | 180 秒 | 大型财报PDF可能包含多页表格与OCR处理,该时长可避免因解析超时导致任务失败 |
max_chunk_per_document | 按实测标定 | 适配不同规模的财报文档,避免因分块过多超出系统处理上限 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:上传将Java接口文档修改为TXT后缀的焦炭行业分析辅助文档后,解析结果无有效数据。原因:Java接口文档包含特定语法结构与代码块,修改后缀后未触发对应格式的解析逻辑,TXT默认解析模式无法过滤无效代码片段,导致无有效业务内容被提取。
- 现象:使用chunk模式调用pushdata API上传焦炭季度财报后,系统长期显示「索引中」状态。原因:未调整
chunk_size与max_chunk_per_document参数,单文档分块数量过多,超出系统并行处理上限,导致索引任务积压。 - 现象:上传包含焦炭产能柱状图的财报PDF后,解析结果未包含图表中的数据内容。原因:未启用
enable_table_parse与适配的解析模式,扫描版图表无法被识别,仅提取了纯文本内容,丢失图表关联的业务数据。
怎么确认配好了
- 上传单页焦炭财报的测试文档,查看解析后的分块列表,确认每个分块包含完整的业务单元。
- 打开解析配置面板,核对
parse_mode与enable_table_parse的设置与当前处理的文档类型匹配。 - 查看解析日志,确认无超时报错或格式解析失败的提示,且分块数量符合预期规模。
- 提取任意分块内容,验证字段与单位的关联关系是否正确。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。