这个品类的数据长什么样
炼化投研知识库的数据主要来自行业协会发布的年度炼化工艺报告、单套装置的运行台账文档、原油物性分析PDF、炼化装置检修规程、产品收率统计表格。数据更新节奏分为定期与实时两类:行业报告按季度或年度更新,装置运行台账按小时级更新。文档结构涵盖长篇幅工艺手册、结构化参数表格、跨格式混合文档,字段与单位包含API重度、馏程温度、硫含量百分比、物料处理量立方米/小时等专业参数。
这些特征在「文档解析与分块」这一环带来什么约束
炼化投研的数据特征对文档解析与分块带来三点核心约束。其一,单文档篇幅较长,部分装置工艺手册可达数百页,常规按固定字符分块易割裂工艺逻辑,需保留工艺单元的完整性。其二,文档包含大量结构化表格,涉及物性参数、收率数据等专业字段,解析时需保留字段与单位的对应关系,避免拆分后数据关联失效。其三,数据源包含跨格式文档,需兼容PDF、Excel、Word等多种格式的结构提取,确保不同来源的投研数据可统一纳入知识库。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PARSE_FILE_TIMEOUT_SECONDS | 300-600 秒 | 炼化文档多为长篇幅PDF,单文档解析耗时较长,需适配大文件解析延迟 |
maxChunkSize | 800-1200 字符 | 炼化文档包含工艺步骤与数据表格,该区间可保留单工艺单元的完整逻辑,避免拆分断裂 |
UPLOAD_FILE_MAX_SIZE | 1000 MB | 单套炼化装置的年度运行报告合集可达数百MB,需适配大容量文件上传 |
chunkOverlap | 100-150 字符 | 工艺描述存在跨块关联的参数,重叠分块可保留上下文连贯性 |
ENABLE_TABLE_PARSE | 开启 | 炼化文档包含大量物性参数表格,开启表格解析可保留字段与单位的对应关系 |
defaultParseEngine | marker | 炼化文档多为复杂排版PDF,marker引擎的解析准确率更高,适配专业投研文档的解析需求 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象为调用文件解析接口返回
504 Gateway Timeout,原因是未调整PARSE_FILE_TIMEOUT_SECONDS参数,默认值过短,无法完成长炼化文档的解析。 - 现象为4.9.0版本中配置
marker解析引擎后解析结果乱码或字段缺失,原因是该版本存在对复杂排版PDF的解析适配缺陷,需降级至4.8.20版本或使用v1 marker引擎。 - 现象为分块结果中表格数据丢失字段对应关系,原因是未开启
ENABLE_TABLE_PARSE配置,默认解析逻辑会将表格拆分为零散文本,无法保留炼化数据的单位与参数关联。
怎么确认配好了
- 上传一份单套装置的工艺手册PDF,查看解析任务的耗时与完成状态,调整
PARSE_FILE_TIMEOUT_SECONDS至适配当前文档的取值。 - 解析后查看分块结果中的表格内容,确认是否保留了参数名称、单位与数值的对应关系,验证
ENABLE_TABLE_PARSE配置是否生效。 - 测试不同长度的文档分块,确认单块内容是否包含完整的工艺单元或数据节点,调整
maxChunkSize与chunkOverlap参数至合理区间。 - 调用文件解析接口,确认返回的分块数据包含文档的来源标识与时间戳,验证元数据保留配置是否正确。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。