炼化研报检索的引用来源与溯源

炼化研报数据主要来自中国石油和化学工业联合会、地方石化行业协会、专业第三方咨询机构及头部炼化企业公开披露文件。更新节奏分三类:行业周报每周更新,月度供需分析

这个品类的数据长什么样

炼化研报数据主要来自中国石油和化学工业联合会、地方石化行业协会、专业第三方咨询机构及头部炼化企业公开披露文件。更新节奏分三类:行业周报每周更新,月度供需分析每月发布,年度产业规划报告按季度或年度更新。文档结构包含核心工艺参数、装置产能与开工率数据、区域市场价差、上下游供需平衡表、政策解读模块,字段包含装置名称、产能单位为万吨/年、开工率百分比字段、价差单位为元/吨,部分研报附带企业生产装置的实地调研细节。

这些特征在「引用来源与溯源」这一环带来什么约束

数据来源分散且分多类更新节奏,要求溯源时需精准绑定每条引用内容的发布机构、发布时间与文档类型,避免跨周期数据混淆。文档包含工艺参数、价差、供需平衡表等多类型结构化字段,溯源需关联字段与对应文档的具体章节,确保引用的参数与原文描述一致。部分研报附带实地调研的企业细节,溯源需保留调研主体信息,保障引用的可信度。不同更新频率的文档时效性要求不同,需在溯源时标注文档的更新周期,便于后续校验数据时效性。

配置怎么定

配置项建议取法这样取的依据
召回条数前8–12条炼化研报单篇内容较长,过多召回会超出上下文窗口,过少则无法覆盖核心数据引用点。
相似度阈值0.72–0.85炼化研报的专业术语较多,阈值过低会引入无关的行业泛文,过高则可能遗漏精准的工艺参数引用。
重排返回条数前3–5条需保留最相关的研报片段用于溯源,同时控制单轮回答的引用数量,避免信息过载。
知识库过滤标签["炼化研报", "石化行业数据"]精准筛选目标品类的知识库文档,排除其他行业的研报干扰。
引用来源展示格式显示文档标题+发布机构+发布时间炼化研报的溯源需明确来源主体与时效性,符合行业数据校验的常规要求。
maxContext8000–12000 字符单篇炼化研报的核心数据章节通常在3000–5000字符,预留足够窗口可完整保留引用片段的上下文。

本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。

容易做错的三处

  • 现象:在工作流的“知识库搜索”节点配置动态知识库时,“引用变量”下拉框无可选变量。原因:未在全局变量管理中创建类型为“知识库ID列表”的变量,或变量未启用公开调用权限。
  • 现象:回答中显示了知识库搜索节点的input和response原始日志内容。原因:未关闭工作流节点的“日志输出”开关,或在回答模板中未过滤工具调用的中间步骤内容。
  • 现象:Mongodb日志中无法区分不同用户、不同会话的炼化研报检索请求。原因:未在日志写入配置中添加session_id和user_id字段作为分组标识,未对知识库来源字段进行单独标注。

怎么确认配好了

  • 发起一次炼化研报相关的查询,查看回答下方的引用来源是否包含文档标题、发布机构与发布时间,核对是否与目标知识库的文档信息一致。
  • 进入工作流的“知识库搜索”节点配置界面,确认“引用变量”下拉框中已出现预设的知识库ID变量。
  • 查看Mongodb日志,确认每条检索请求都带有session_id、user_id和knowledge_base_tags字段,可按会话或知识库来源分组查看日志。
  • 调整相似度阈值为0.9,发起查询,确认召回的文档数量明显减少,验证阈值配置的生效性。

问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。