炼化投研知识库建设的部署与升级

炼化投研数据主要来自装置运行日志、原油质检报告、工艺规程文档、上下游供需台账与行业公开研报。结构化数据包含装置温度、压力、处理量等参数,附带℃、MPa、吨/

这个品类的数据长什么样

炼化投研数据主要来自装置运行日志、原油质检报告、工艺规程文档、上下游供需台账与行业公开研报。结构化数据包含装置温度、压力、处理量等参数,附带℃、MPa、吨/小时等专属单位;非结构化数据多为长文档,包含工艺优化方案、故障排查记录。实时运行数据更新频率为分钟级,行业研报按周或月更新,工艺文档每季度同步修订。

这些特征在「部署与升级」这一环带来什么约束

炼化投研数据包含大量带专属单位的结构化参数与长文本非结构化文档,且实时运行数据更新频率较高。部署阶段需适配多源异构数据的接入格式,避免因单位不匹配导致解析失败;升级过程中需保证实时数据链路不中断,防止影响投研实时分析。长文档占比高会拉长单文件解析时长,需预留足够的服务资源,同时需提前兼容旧版数据的字段结构,避免升级后历史数据无法正常召回。

配置怎么定

配置项建议取法这样取的依据
PARSE_FILE_TIMEOUT_SECONDS600 秒炼化单份工艺文档或运行日志常超出常规文档长度,延长解析时长可避免超时失败
UPLOAD_FILE_MAX_SIZE1000 MB炼化研报、装置日志合集常为数百MB规模,放宽上传上限可支持完整知识库导入
SIMILARITY_THRESHOLD0.75–0.85炼化结构化参数的匹配精度要求较高,需过滤低匹配度的无关数据
CHUNK_SIZE1000–1200 字符炼化工艺文档包含连续的步骤描述,分段长度适配可兼顾语义完整性与召回精度
PYTHON_EXEC_TIMEOUT300 秒炼化投研常需运行批量数据计算脚本,预留足够时长可避免长时任务提前终止
VECTOR_DB_REFRESH_INTERVAL60 秒炼化实时运行数据需高频同步至向量库,保障投研分析的时效性

本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。

容易做错的三处

  • 现象为模型后台有响应日志,但工作流对话显示失败,原因是部署时未正确配置工作流的模型调用链路,或未开放对应端口供工作流模块访问模型服务。
  • 现象为从版本V4.9.3、V4.9.13升级到V4.12.2后原有知识库数据丢失,原因是未将向量数据库与文件存储的目录挂载到宿主机,执行docker-compose down时会删除临时容器内的存储数据。
  • 现象为Python代码节点执行后无输出或报错,原因是未配置Python运行环境的依赖包,或设置的PYTHON_EXEC_TIMEOUT时长不足,导致长时计算任务提前终止。

怎么确认配好了

  • 上传一份典型的炼化工艺文档,检查解析后的分段是否保留了关键参数与单位,核对解析进度无超时报错。
  • 运行包含结构化参数检索的测试工作流,确认返回结果的字段与单位符合炼化数据规范。
  • 执行Python代码测试节点,验证脚本可正常读取知识库数据并输出预期结果。
  • 执行版本升级流程后,检查原有知识库的召回结果与升级前一致,确认存储挂载配置生效。

问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。