这个品类的数据长什么样
焦炭相关数据主要来自大连商品交易所期货行情、中国炼焦行业协会行业报告、沿海港口现货报价系统、钢厂采购台账四类渠道。更新节奏覆盖交易日实时更新的期货成交价、每日更新的港口现货报价、每周发布的行业供需周报及每月更新的产业全景报告。单份文档多为结构化表格或带有明确数据标注的文本,包含交割品级、全硫分、灰分、挥发分、抗碎强度M40、耐磨强度M10等核心字段,单位多为百分比、元/吨、千克/立方米。
这些特征在「引用来源与溯源」这一环带来什么约束
多渠道来源导致需要精准匹配数据源标识,不同渠道的同字段命名可能存在差异,比如港口报价用“全硫”而行业报告用“硫分”,需要统一映射。更新频率差异要求溯源时标注数据采集时间,避免混淆当日现货与周度报告数据。结构化与非结构化混合的文档格式,要求溯源时同时支持表格单元格级定位与文本段落定位。核心字段的专业单位要求溯源信息中必须携带单位标识,防止出现“硫分0.8”这类歧义表述。跨周期数据的引用需关联对应报告的发布周期,确保投研结论的时间维度准确。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
rag_top_k | 前15-20条 | 焦炭投研数据维度多,需覆盖期货、现货、行业报告等多类数据源,过多会超出上下文窗口,过少会遗漏关键产业数据 |
similarity_threshold | 0.72-0.85 | 焦炭专业术语辨识度高,阈值过低会引入无关的煤炭品类数据,过高会遗漏同品类不同批次的有效信息 |
rerank_top_n | 前8-12条 | 重排可过滤跨渠道的重复数据,焦炭行业存在多渠道重复发布的报价信息,保留前8-12条可兼顾全面性与精准性 |
citation_include_fields | ["数据源名称","采集时间","单位"] | 焦炭数据的单位与采集时间是投研溯源的核心依据,需强制携带 |
max_context_tokens | 8000-12000 tokens | 焦炭投研文档常包含多组表格数据,较长的上下文窗口可完整承载溯源信息与业务内容 |
enable_citation_log | 开启 | 需留存每条引用的原始文档路径与片段,便于后续投研结论的回溯校验 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:生成内容中残留无法手动移除的引用标记。原因:未禁用
show_citation界面配置项,默认开启的引用渲染逻辑会自动附加来源标识,且未通过模板变量移除预设的引用格式。 - 现象:前端展示的上下文条数与实际调用接口的引用条数不符。原因:未同步配置
rag_top_k和rerank_top_n的取值,重排环节会过滤部分召回结果,但前端仍展示原始召回的总条数,导致数值偏差。 - 现象:触发“超出引用上限”的报错提示。原因:未设置
max_citation_per_request参数,或取值小于当前召回的有效数据源数量,系统会拦截超出预设阈值的引用请求。
怎么确认配好了
- 向知识库上传一份最新的焦炭港口现货报价文档,发起包含“当前唐山港二级冶金焦报价”的查询,核对返回结果中是否携带数据源名称、采集时间与单位信息。
- 查看推理接口的返回日志,对比前端展示的引用条数与日志中携带的
citation_list数组长度,确认数值一致。 - 手动修改
similarity_threshold至0.6,发起查询,确认返回结果中未引入非焦炭品类的煤炭数据,验证阈值配置生效。 - 关闭
enable_citation_log配置,再次发起查询,确认日志中无溯源相关的字段记录,验证开关配置生效。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。