这个品类的数据长什么样
储能智能尽调报告的数据主要来自储能项目可研报告、并网验收档案、设备出厂台账、现场运维日志及电力监管上报文件。更新节奏随项目阶段变化,立项阶段每1-2周更新一次,并网后转为月度运维更新。文档结构包含设备参数模块、项目合规文件、并网指标清单、财务测算表,字段涉及储能系统额定装机容量、并网电压等级、设备序列号、项目备案编号,单位包含MW、kV等电力行业专用标识。
这些特征在「文档解析与分块」这一环带来什么约束
来源分散导致文档格式混杂,既有结构化表格又有非结构化段落,解析时需区分设备参数表与合规说明文本。更新节奏波动导致解析任务峰值集中,需适配短时高并发的解析处理能力。字段单位多样且涉及电力行业专用标识,分块时需保留单位关联信息,避免参数与单位脱节。单份储能尽调报告可达数十页,长文档需精准拆分核心参数段落,防止关键信息跨块丢失。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 储能尽调报告单份长度可达数十页,需预留充足的解析与分块时间 |
maxChunkSize | 800–1200 字符 | 储能文档包含长参数段落与结构化表格,该区间可完整保留参数与单位的关联信息 |
chunkOverlap | 100–150 字符 | 避免核心设备参数被拆分至两个分块,保障上下文连贯性 |
UPLOAD_FILE_MAX_SIZE | 1000 MB | 单份储能尽调报告可能包含图纸、台账等附件,需支持大文件上传 |
PARSE_ENGINE | marker | 可精准解析储能文档中的复杂表格与专用参数格式 |
enable_table_parse | 开启 | 完整提取设备参数表格中的字段与单位,防止信息遗漏 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 调用marker解析时出现split相关报错日志,解析任务失败。未针对储能文档的长表格段落配置合适的分块参数,导致解析引擎尝试拆分超出阈值的表格内容。
- docker部署v4.9.0版本时,文件解析后返回的文本内容为空。未正确配置
UPLOAD_FILE_MAX_SIZE参数,或部署时未挂载解析模块的文件存储目录,导致大文件无法完整上传解析。 - 解析后的分块内容中设备参数与单位脱节。未开启
enable_table_parse配置,导致表格中的参数与单位被拆分至不同分块。
怎么确认配好了
- 上传一份本地储能尽调报告的样本文档,查看解析后的文本内容是否包含完整的设备参数与单位信息。
- 查看解析任务的日志,确认未出现split相关报错或超时提示。
- 检查配置项的实际生效值,确认
PARSE_ENGINE为marker且enable_table_parse处于开启状态。 - 测试分块后的召回效果,确认核心参数段落未被过度拆分。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。