这个品类的数据长什么样
煤化工财报数据主要来自上海证券交易所、深圳证券交易所披露的上市公司定期报告,中国煤化工行业协会发布的研究简报,以及企业自主披露的月度运营数据。更新节奏分为年度、季度与月度三类,年度报告每年披露一次,季度报告每季度更新,行业简报每月发布。文档通常包含合并财务报表、产能与产量明细、原料与能源消耗数据、产品营收构成说明,以及项目建设进度内容。字段包含产品产量、单位生产成本、原料采购量等,对应单位多为万吨、元/吨、小时等。
这些特征在「文档解析与分块」这一环带来什么约束
煤化工财报的文档结构包含混合格式内容,既有标准化财务表格,也有非结构化的项目说明文本,常规分块逻辑易割裂表格与对应文字的关联。不同企业披露的字段单位存在差异,部分企业以吨为单位,部分以万吨为单位,分块时需保留字段与单位的上下文绑定,避免后续检索时出现单位混淆。单篇文档长度波动较大,月度简报仅数页,年度报告可达数百页,分块逻辑需适配不同长度的文档,避免对长文档过度截断或对短文档过度拆分。行业专业术语如煤制烯烃、粗苯精制等需保留完整上下文,避免拆分后语义断裂。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
chunkSize | 800–1200 字符 | 适配煤化工财报的文本长度,避免割裂专业术语与表格关联内容 |
chunkOverlap | 100–150 字符 | 保留跨分段的上下文关联,适配长文本与跨页表格内容 |
tableParseMode | 完整表格块 | 保留煤化工财报中产能、成本表格的完整结构,避免拆分表格数据 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 适配单篇数百页的年度财报解析时长 |
UPLOAD_FILE_MAX_SIZE | 1000 MB | 支持批量上传年度财报与行业合集文档 |
splitMode | 按章节优先 | 优先按财报的章节标题拆分分块,适配结构化财报文档 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:解析大型煤化工年报时,出现单段文本超出设定长度的报错,或分块结果被强制截断。原因:未明确
chunkSize的单位为字符,误将字节数作为取值依据,或未调整splitMode适配结构化文档。 - 现象:调用FastGPT 4.8.10版本API解析财报后,返回结果中未包含分块索引字段。原因:未在API请求参数中开启
includeChunkIndex开关,或该版本的API参数配置存在兼容问题。 - 现象:前端页面点击复制分块内容时,弹出“无法使用浏览器自动复制,请手动复制下面内容”的提示。原因:页面部署存在非同源限制,浏览器跨域复制权限被拦截,未调整复制逻辑适配该场景。
怎么确认配好了
- 上传一篇煤化工企业的年度财报文档,查看解析后的分块列表,确认表格内容未被拆分,核对分块长度与设定的
chunkSize参数匹配。 - 调用文档解析API,检查返回结果中是否包含分块索引字段,确认与
includeChunkIndex参数的配置一致。 - 上传单篇超过300页的行业报告,查看解析任务的状态,确认未触发
PARSE_FILE_TIMEOUT_SECONDS对应的超时错误。 - 测试不同格式的煤化工财报文档(PDF、Word),确认解析后的分块结构符合
splitMode的配置要求。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。