动力煤投研知识库建设的文档解析与分块

动力煤相关投研数据来源涵盖产地生产台账、沿海港口库存周报、期货交易所每日行情日报、行业协会季度研报及长协合同文档。数据更新节奏差异明显:港口库存为周度更新,

这个品类的数据长什么样

动力煤相关投研数据来源涵盖产地生产台账、沿海港口库存周报、期货交易所每日行情日报、行业协会季度研报及长协合同文档。数据更新节奏差异明显:港口库存为周度更新,期货行情为实时更新,行业研报为月度更新,长协合同为单次归档。文档类型包含PDF格式的结构化研报、Excel格式的库存与价格台账、CSV格式的行情日报,部分文档包含合并单元格的表格。核心字段包含发热量(单位:大卡/千克)、硫分(单位:%)、灰分(单位:%)、产地、到港价(单位:元/吨),以及长协合同中的交割条款与定价规则。

这些特征在「文档解析与分块」这一环带来什么约束

多源异构的文档类型要求解析环节适配不同格式的解析逻辑,避免单一策略导致CSV行情数据丢失、PDF研报的图表文本无法提取。明确的字段与单位要求分块时需保留字段与单位的绑定关系,不能将字段与对应单位拆分至不同分块,否则会影响投研逻辑的完整性。高频更新的实时与周度数据要求增量解析能力,避免全量重跑带来的资源浪费与延迟。长协合同中的混合结构化与非结构化内容,要求解析环节区分表格条款与文本描述,分别适配结构化提取与语义分块的需求。

配置怎么定

配置项建议取法这样取的依据
OCR_PROVIDERpytesseract动力煤投研文档多为中文研报与台账,该引擎适配中文识别需求
PARSE_TABLE_STRATEGYstructured_extract动力煤文档包含大量结构化表格,该策略可保留单元格关联与字段完整性
CHUNK_SIZE800–1200 字符动力煤研报段落密度适中,该区间可覆盖单条核心投研逻辑,避免分块断裂
CHUNK_OVERLAP100–150 字符保留跨分块的行业术语关联,如“基准发热量”的上下文连贯性
PARSE_TIMEOUT300 秒适配大型行业研报与多工作表Excel台账的解析耗时需求
UPLOAD_FILE_MAX_SIZE500 MB匹配单份大型行业研报PDF的常见文件大小上限

本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。

容易做错的三处

  • 现象:OCR解析后的中文文本出现乱码、生僻字符缺失,查看日志显示识别错误码1001。原因:未指定中文语言包,或系统未安装tesseract-ocr-chi-sim语言包,导致中文识别失效。
  • 现象:Excel表格导入知识库后,元数据显示正常但检索结果无表格内容,查看解析任务状态显示TABLE_PARSE_FAILED。原因:未开启PARSE_TABLE_CONTENT参数,或表格存在多层合并单元格导致解析逻辑无法正确提取单元格内容。
  • 现象:检索结果中辅助数据(如文档更新时间、文件路径)优先于核心投研逻辑,查看分块日志显示辅助字段得分高于业务字段。原因:未配置RERANK_SCORE_THRESHOLD过滤低价值字段,或分块时未为核心业务字段设置权重标记。

怎么确认配好了

  • 上传一份动力煤港口库存Excel台账,查看解析后的表格详情,确认所有字段均保留对应单位(如“到港价”后标注“元/吨”)。
  • 运行1份500 MB以内的行业研报PDF解析任务,检查任务状态无超时报错,解析耗时符合PARSE_TIMEOUT设定范围。
  • 检索“动力煤基准发热量标准”,查看分块内容是否覆盖完整逻辑,无术语断裂或上下文丢失情况。
  • 查看OCR解析后的中文文本片段,确认无乱码字符,验证OCR_PROVIDER配置的语言包生效。

问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。