这个品类的数据长什么样
能源金属财报数据主要来源于境内外证券交易所定期报告、行业协会产能统计文档及现货市场报价公告。更新节奏以季度报告每3个月更新一次、年度报告每年一次为主,临时公告随行业事件或企业动态发布。单份财报PDF的页数差异较大,建议按自有样本统计或实测后再确定,结构涵盖合并财务报表、金属探明储量明细表、冶炼产能利用率数据等,字段包含探明储量(单位:吨)、单季度营收(单位:亿元)、原材料采购成本(单位:元/吨)等,部分文档会嵌入内嵌表格的图片页面。
这些特征在「文档解析与分块」这一环带来什么约束
能源金属财报的多页内嵌表格、结构化数值字段与高专业术语密度,对文档解析与分块环节带来多重约束。首先,内嵌表格多跨多页,解析时需保留表格整体结构,避免拆分数值与对应说明;其次,单份文档页数较多且包含大量关联数值段落,分块边界需避开专业术语的中间位置,防止语义断裂;另外,临时公告更新频率较高,解析流程需适配批量快速处理,避免因冗余逻辑增加耗时。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
parser_mode | ocr+markdown | 能源金属财报包含大量内嵌表格的图片页面,纯文本解析无法提取表格内的结构化数据,OCR模式可还原表格结构 |
chunk_size | 800–1200 字符 | 能源金属财报的结构化数值段落与行业术语组合的平均长度在该区间,可保留单条关联信息的完整性 |
chunk_overlap | 100–150 字符 | 跨页表格或长术语段落可能跨越分块边界,重叠部分可保证语义连贯性 |
enable_table_merge | 开启 | 能源金属财报存在大量跨页表格,开启后可自动合并跨页的同表格内容,避免分块拆分表格结构 |
PARSE_FILE_TIMEOUT_SECONDS | 300 秒 | 单份能源金属财报PDF页数较多,OCR解析与分块处理需较长耗时,该时长可覆盖绝大多数单份文档的处理流程 |
custom_separator | [\n\n, 第\d+章, 表\d+] | 能源金属财报的章节与表格编号为天然分块边界,可精准控制分块起始位置 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:配置
custom_separator与chunk_size后,分块结果要么合并多个独立段落,要么将单段长文本拆分为多个不完整块。原因:未针对能源金属财报的章节编号、表格编号设置精准的自定义分隔符,同时未调整chunk_overlap参数匹配长数值段落的语义边界。 - 现象:部署Marker后处理PDF报错,返回
{"detail":"处理超时"}或状态码500。原因:未调整PARSE_FILE_TIMEOUT_SECONDS参数至适配能源金属财报页数的时长,或服务器内存不足以支撑OCR解析多页PDF。 - 现象:分块结果中表格内容被拆分为多个独立块,且数值与对应说明分离。原因:未开启
enable_table_merge参数,或parser_mode未设置为ocr+markdown模式,导致无法识别内嵌表格的结构。
怎么确认配好了
- 上传一份单页包含内嵌表格的能源金属财报样例,查看解析后的文本是否完整还原表格内的所有数值与说明文字。
- 查看分块结果的文本块,确认章节标题、表格编号均作为分块起始标识,未出现跨专业术语的分块拆分。
- 批量上传多份同类型财报文档,核对解析耗时是否符合预期,未出现超时报错。
- 检索分块后的知识库,确认关联的数值字段与对应说明文本出现在同一块或相邻块中。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。