焦炭投研知识库建设的多轮对话与提示词

焦炭行业数据主要来自中国煤炭工业协会月度供需报告、主产区现货市场每日挂牌价、期货交易所交割库库存周报、钢厂采购台账。更新节奏分为日更(现货价格、期货结算价)

这个品类的数据长什么样

焦炭行业数据主要来自中国煤炭工业协会月度供需报告、主产区现货市场每日挂牌价、期货交易所交割库库存周报、钢厂采购台账。更新节奏分为日更(现货价格、期货结算价)、周更(产区库存、运费数据)、月更(行业供需平衡表)。文档格式以PDF行业报告和结构化表格为主,核心字段包括吨价(单位元/吨)、硫含量、灰分、交割库库容(单位万吨),部分长文档包含上下游产业链联动数据。

这些特征在「多轮对话与提示词」这一环带来什么约束

数据更新频率差异大,多轮对话需实时召回最新的现货价与库存数据,无法依赖静态缓存;专业字段与单位统一要求高,提示词需明确指定元/吨、百分比等单位,避免结果歧义;多来源数据口径不同,多轮交互中需引导用户明确数据来源类型;长文档占比高,多轮上下文需预留足够空间容纳多份召回文档,避免内容溢出。

配置怎么定

配置项建议取法这样取的依据
maxContext8000–12000 字符焦炭相关文档单篇较长,多轮对话需保留多轮交互上下文与多份召回的跨来源数据
recallTopK前10–15条焦炭数据来源覆盖现货、期货、行业报告等多个渠道,需召回足够数量的结果以覆盖不同口径
similarityThreshold0.72–0.80焦炭与其他煤炭品类术语相似度较高,需过滤低相关性的非焦炭数据,同时保留口径差异的相关内容
reRankTopN前5–8条需精简召回结果,避免多轮对话上下文过载,同时保留核心产区价格、期货结算价、库存数据
promptTemplate按「产区+品类+指标+单位」格式整理结果,明确标注数据来源与更新时间焦炭数据单位统一为元/吨、百分比等,需避免歧义,同时帮助用户追溯数据口径
conversationTimeout60 秒实时数据查询需快速响应,超时会导致用户重复发起请求,影响交互体验

本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。

容易做错的三处

  • 现象为对话返回Request Timeout错误,原因是未将conversationTimeout配置为适配实时现货数据查询的合理时长,导致大模型召回多份长文档时超出预设阈值。
  • 现象为召回结果中混杂其他煤炭品类数据,原因是similarityThreshold设置过低,未过滤非焦炭的通用煤炭文档,导致相关性不足的内容被召回。
  • 现象为对话返回的价格数据未标注单位,原因是promptTemplate未明确要求统一使用元/吨作为价格单位,导致结果存在口径歧义。

怎么确认配好了

  • 上传一份最新的焦炭产区现货周报,发起多轮对话询问上周各产区的吨价,核对返回结果是否包含正确的产区、价格与单位。
  • 调整similarityThreshold至0.75,发起包含“煤炭”“焦炭”的混合查询,核对召回结果中焦炭相关内容占比是否符合预期。
  • 发起连续3轮对话,分别询问现货价、期货结算价、库存数据,核对上下文是否保留了前两轮的查询关键词与结果。
  • 查看对话日志,确认conversationTimeout未触发超时错误,且每次对话响应时长稳定在合理区间。

问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。