炼化研报检索的工作流编排

炼化研报的数据主要来自中国石油和化学工业联合会官网、各炼化企业披露的月度运营公告、专业行业咨询机构的定制研报。常规更新节奏为季度发布,涉及产能调整、原料价格

这个品类的数据长什么样

炼化研报的数据主要来自中国石油和化学工业联合会官网、各炼化企业披露的月度运营公告、专业行业咨询机构的定制研报。常规更新节奏为季度发布,涉及产能调整、原料价格波动等重大变动时,会在72小时内发布补充文档。文档结构包含行业整体加工量、单装置产能、原料采购成本、产品出厂价格、盈利测算等模块,字段包含加工量(单位:万吨)、单装置设计产能(单位:万吨/年)、原料采购价(单位:元/吨)、产品售价(单位:元/吨)。

这些特征在「工作流编排」这一环带来什么约束

多源数据的格式差异会带来字段标准化的需求,需配置统一的字段映射节点处理不同来源的单位与命名差异。非固定的更新节奏要求工作流支持触发式同步,避免无效的资源消耗。长且结构化的文档内容需要合理的分段规则,防止拆分破坏核心数据模块的完整性。专业性较强的内容还需要前置校验节点,过滤非核心的行业评论,仅保留可用于检索的结构化数据。

配置怎么定

配置项建议取法这样取的依据
PARSE_DOC_SPLIT_LENGTH800–1200 字符炼化研报的核心数据模块长度集中在该区间,避免拆分破坏数据完整性
KNOWLEDGE_RECALL_TOP_N前 8 条炼化研报的核心数据条目较多,召回过少会遗漏关键产能或价格信息
LLM_CONTEXT_WINDOW_LIMIT16384 令牌单篇研报解析后文本长度较长,适配主流大模型的上下文窗口
DATA_SOURCE_SYNC_TRIGGER按文档更新时间触发炼化研报更新节奏不固定,定时同步会产生无效拉取
FIELD_UNIT_CONVERSION_RULE按实测标定不同来源的单位格式差异较大,需针对接入的数据源单独配置转换规则
PARSE_FILE_TIMEOUT_SECONDS120 秒单篇长研报的解析耗时较长,避免超时中断

本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。

容易做错的三处

  • 现象:工作流中生成的结构化回复与原文内容错位,核心数据字段匹配错误。原因:未配置合理的文档分段规则,LLM无法准确识别研报中的结构化数据模块,导致标记符匹配失败。
  • 现象:知识库搜索调试正常,但AI对话调用时未返回炼化研报的相关内容。原因:未将炼化研报的专属分类标签添加到检索配置中,或召回条数设置过低,无法覆盖所需信息。
  • 现象:工作流执行时频繁出现超时中断。原因:未调整PARSE_FILE_TIMEOUT_SECONDS的取值,单篇长研报的解析耗时超出默认设置。

怎么确认配好了

  • 上传单篇典型炼化研报,查看解析后的文本分段,确认拆分后的模块未破坏核心数据结构,调整PARSE_DOC_SPLIT_LENGTH直至符合预期。
  • 发起测试对话,输入炼化行业的具体问题,检查返回结果中是否包含知识库中的研报数据,调整召回配置直至覆盖所需信息。
  • 模拟触发一次数据同步,检查是否仅在研报更新时拉取新内容,避免无效同步。
  • 运行完整工作流,检查执行日志中是否存在超时或字段解析错误,调整对应配置项直至无异常。

问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。