这个品类的数据长什么样
焦煤研报的数据源主要覆盖煤炭行业自律组织、大宗商品交易平台、专业咨询机构及产业链上下游企业公开披露的研究内容。文档格式存在差异,部分为纯文本分析报告,部分附带结构化数据表格与可视化图表。单篇内容包含核心指标摘要、供需形势分析、价格走势研判、政策影响分析等模块,更新周期按行业惯例分层,包含周度跟踪、月度汇总及季度深度分析内容。内容包含焦煤专属的品质与流通指标,配套行业通用的计量单位。
这些特征在「引用来源与溯源」这一环带来什么约束
焦煤研报的多源数据源与格式差异,要求溯源环节需兼容多种解析规则,准确匹配引用内容与原始来源的具体位置。焦煤包含专属指标,溯源时需精准关联对应字段的原始披露内容,避免与其他煤炭品类数据混淆。研报更新周期存在分层,周度跟踪内容与季度深度分析的时效性要求不同,溯源环节需同步标注内容的发布时间与更新周期,确保引用的时效性可验证。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
ragRecallTopK | 前8-12条 | 焦煤研报的指标维度较多,需召回足够数量的相关内容覆盖核心分析方向,避免遗漏关键溯源依据 |
rerankTopN | 前3-5条 | 焦煤研报的有效关联内容集中度较高,过多重排结果会增加溯源匹配的计算成本与复杂度 |
ragSimilarityThreshold | 0.75-0.85 | 焦煤专属指标的语义差异度较高,该阈值可过滤低匹配度的无关煤炭品类研报内容 |
chunkOverlap | 150-250字符 | 焦煤研报的核心指标常跨分段分布,重叠分段可保留完整的上下文关联,提升溯源准确性 |
enableSourceCitation | 开启 | 焦煤研报的引用溯源为核心功能需求,需强制展示原始来源的具体位置与发布信息 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:召回的引用文档数量远超预设值,且包含大量非焦煤品类的研报内容。原因:
ragSimilarityThreshold参数设置过低,未过滤低语义匹配度的无关内容,导致溯源范围过大。 - 现象:回答引用的内容并非知识库中综合关联度最高的焦煤研报内容。原因:未启用重排排序环节,或
rerankTopN参数设置过小,未将最相关的溯源候选纳入最终展示范围。 - 现象:大模型生成的引用说明与原始文档的具体位置不符,出现章节、表格或指标描述错误。原因:
chunkOverlap参数设置不合理,分段重叠率不足,导致核心指标与分析上下文被拆分,无法建立准确的溯源关联。
怎么确认配好了
- 上传1-2篇公开的焦煤研报与其他煤炭品类研报,执行检索测试,核对召回结果中焦煤相关内容的占比,调整对应参数至符合需求的区间。
- 查看检索结果的源内容展示模块,核对每个引用结果是否标注了原始文档的发布时间、来源主体与具体章节位置,确认溯源配置已生效。
- 生成一段焦煤核心指标相关的提问,查看回答中引用的内容是否与原始研报的分段内容匹配,调整分段相关参数以优化关联准确性。
- 测试不同检索阈值的召回效果,核对引用内容的相关性与数量,确保配置符合业务的溯源精度要求。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。