焦煤投研知识库建设的多轮对话与提示词

焦煤数据主要来自大连商品交易所公开行情、中国煤炭工业协会行业报告、主产区矿山企业公开运营数据、沿海港口通关台账。行情类数据按日更新,部分实时行情每15分钟刷

这个品类的数据长什么样

焦煤数据主要来自大连商品交易所公开行情、中国煤炭工业协会行业报告、主产区矿山企业公开运营数据、沿海港口通关台账。行情类数据按日更新,部分实时行情每15分钟刷新一次;行业报告按周、月或季度更新;企业财报按季度、年度发布。文档结构分为结构化表格与半结构化报告两类:结构化行情文档包含交割地、交割品级、结算价、持仓量等字段,单位为元/吨、万吨;半结构化报告包含产能、进口量、运输成本等统计项,字段命名统一遵循行业通用规范。

这些特征在「多轮对话与提示词」这一环带来什么约束

焦煤数据的多维度细分与实时性要求,对多轮对话与提示词配置形成多重约束。首先,实时行情数据的时效性极强,提示词需明确要求优先召回24小时内的文档,避免引用过时数据。其次,投研对话常涉及连续递进式提问,如先确认某交割地的主焦煤价格,再询问环比变化,需保留历史对话中的交割地、品级等关键参数,无需用户重复说明。此外,焦煤数据的字段细分度高,提示词需强制要求匹配交割品级、交割地等精准字段,否则易混入其他煤炭品类的无关数据。最后,单份行业报告篇幅较长,需限制上下文召回的总长度,避免超出模型token上限。

配置怎么定

配置项建议取法这样取的依据
maxContext前10轮对话焦煤投研对话多涉及连续的行情、政策追踪,过多历史会稀释当前问题的上下文精度
RECALL_TOP_N前8条焦煤数据包含行情、库存、政策多维度,过多召回会导致prompt过长
SIMILARITY_THRESHOLD0.75–0.82焦煤数据字段细分(交割地、品级),阈值过低会混入无关品类的煤炭数据
PARSE_FILE_TIMEOUT_SECONDS120 秒焦煤的季度行业报告文档篇幅较长,解析需预留足够时间
UPLOAD_FILE_MAX_SIZE500 MB焦煤的历史行情数据库文件体积较大
WORKFLOW_AI_CHAT_TIMEOUT600 秒多轮投研对话可能涉及多文档整合计算,需延长超时时间

本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。

容易做错的三处

  • 现象:工作流使用AI对话组件触发未捕获异常,日志显示504 Gateway Timeout。原因:未将PARSE_FILE_TIMEOUT_SECONDS调至适配焦煤长文档的取值,导致文档解析超时。
  • 现象:通过Python调用API发起对话,生成的回复未引用知识库文档。原因:未在请求体中正确携带kbIds参数,或SIMILARITY_THRESHOLD设置过高导致无匹配召回结果。
  • 现象:对话页面或知识库页面崩溃,前端控制台显示Uncaught TypeError。原因:使用了存在前端渲染漏洞的4.8.20版本,需更换至稳定版本。

怎么确认配好了

  • 发起单轮对话测试,提问指定交割地和品级的焦煤价格,核对回复中是否包含对应字段的精准数据。
  • 发起连续3轮递进式提问(如先问主焦煤库存,再问环比变化,最后问影响因素),核对上下文是否被正确保留。
  • 上传单份焦煤行业报告,检查解析后的文档字段是否完整匹配原文档的结构与单位。
  • 触发工作流AI对话组件,查看日志中是否存在超时或参数错误的提示。

问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。