这个品类的数据长什么样
焦煤相关数据主要来自国内主产区矿山的生产台账、北方港口的现货交易台账、期货交易所的交割结算数据、行业自律组织的供需调研。更新节奏分为三类:现货交易数据每日更新,交割结算数据随交割完成即时更新,行业调研数据每月更新。文档多为结构化表格,包含产地标识、交割品级参数、现货交易价格、港口库存总量、上下游开工率数值、跨区域运输里程等字段,单位涵盖元/吨、万吨、千米等。
这些特征在「多轮对话与提示词」这一环带来什么约束
焦煤数据的多维度更新节奏要求多轮对话中动态区分实时与历史数据的调用优先级,避免返回过时信息。细分字段较多的特征要求提示词必须明确指定需调取的字段范围,防止模型生成无关内容。跨数据源的格式差异要求多轮对话中引导用户补充特定维度的信息,比如区分港口现货与产区出厂价。月度更新的行业调研数据则要求在对话中明确提示当前可获取的最新数据周期,避免用户获取过期内容。同时,多轮对话需保留上下文关联,确保用户的连续追问能得到连贯回应。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
maxContext | 8000–12000 字符 | 焦煤智能尽调的多轮对话需保留多轮追问的行业数据与用户需求,该长度可覆盖完整上下文 |
召回条数 | 前6–8条 | 焦煤数据包含价格、库存、运输等多维度细分字段,需召回足够数量的知识库条目覆盖需求 |
相似度阈值 | 0.72–0.80 | 焦煤专业术语较多,需平衡召回相关性与覆盖范围,避免遗漏细分字段数据 |
分段长度 | 1000–1500 字符 | 焦煤数据的结构化字段密集,分段需保留字段关联性,避免拆分破坏数据逻辑 |
PARSE_FILE_TIMEOUT_SECONDS | 300 秒 | 行业调研文档通常篇幅较长,需预留足够时间完成结构化解析 |
REMOVE_THINK_TAG | 开启 | 模型生成的思考标签会干扰尽调报告格式,需自动移除 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:工作流运行后,AI回复仍包含
<think>标签包裹的内容。原因:未开启REMOVE_THINK_TAG配置项,或代码节点未在生产环境触发。 - 现象:知识库回答出现截断,无法输出完整的焦煤尽调字段内容。原因:
maxContext设置过小,或分段长度不合理导致上下文溢出。 - 现象:生成的尽调报告未包含指定的焦煤交割品级数据。原因:召回条数设置过低,或提示词未明确限定需调取的细分字段范围。
怎么确认配好了
- 发起包含焦煤现货价格、港口库存、跨区域运输成本的多轮追问,核对回复是否完整覆盖追问维度且无无关内容。
- 上传一份标准焦煤行业调研文档,检查解析后的文本分段是否保留字段关联性,未出现逻辑断裂的拆分结果。
- 触发包含代码节点的工作流,验证AI生成内容中是否无
<think>标签包裹的内容,输出格式符合尽调报告要求。 - 修改
相似度阈值参数,对比两次召回的知识库条目,确认召回结果的相关性符合业务判断标准。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。