焦炭研报检索的引用来源与溯源

焦炭研报的数据来源涵盖中国炼焦行业协会公开统计、大连商品交易所行情数据、钢厂实地调研记录、产业链数据平台监测报告等。更新节奏覆盖每日现货价格、每周供需台账、

这个品类的数据长什么样

焦炭研报的数据来源涵盖中国炼焦行业协会公开统计、大连商品交易所行情数据、钢厂实地调研记录、产业链数据平台监测报告等。更新节奏覆盖每日现货价格、每周供需台账、月度行业分析报告三类频率。文档结构通常包含核心指标、原料炼焦煤成本占比、下游钢材需求数据、政策调控动态等字段,单位多为元/吨、万吨/年、百分比等专业工业统计单位。

这些特征在「引用来源与溯源」这一环带来什么约束

这些特征对溯源环节的约束主要体现在三个方面:其一,多来源的数据要求溯源信息需明确标注发布主体类型,避免混淆行业协会与交易平台的统计口径;其二,高频更新的数据需要在溯源中附带发布时间,帮助使用者判断数据时效性;其三,细分字段多且专业的结构要求溯源需精准对应到具体字段的来源段落。此外,焦炭作为煤炭大类下的细分品类,其数据易与其他煤炭品类混淆,溯源环节需额外明确品类关联标签,防止跨品类引用错误。

配置怎么定

配置项建议取法这样取的依据
召回条数前20条覆盖多来源的最新焦炭研报数据,避免遗漏细分领域的关键信息
相似度阈值0.75–0.85过滤低相关的跨品类内容,保留与焦炭核心指标高度匹配的检索结果
maxContext12000–15000 token适配焦炭研报长段落的专业分析内容,保证溯源时可展示完整的上下文关联
引用条数上限10–15条控制输出的溯源信息总量,避免过多引用导致内容冗余
分段长度4000–5000 token匹配焦炭研报的长文档结构,平衡上下文完整性与检索精准度
重排返回条数前8条优先展示与焦炭核心指标最相关的结果,简化溯源展示的复杂度

本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。

容易做错的三处

  • 现象:设置引用条数上限为1500后,返回的引用内容token数超出限制。原因:未对检索到的分段内容做单段长度截断,仅限制了召回的分段总数,未匹配FastGPT 4.6.7版本的单段引用token规则。
  • 现象:检索结果中出现非焦炭品类的研报内容。原因:相似度阈值设置过低,误匹配了煤炭大类下其他品类的文档,未过滤无关的专业术语关联内容。
  • 现象:引用溯源中未标注研报的发布时间。原因:未在文件解析环节开启「保留元数据」选项,丢失了研报的发布时间字段,无法在溯源展示中补充时效性信息。

怎么确认配好了

  • 上传一份公开的焦炭研报文档,触发检索后查看返回结果的引用来源,确认包含发布机构、发布时间等元数据信息。
  • 发起包含焦炭核心指标的查询,核对返回的引用条数是否符合预设的引用条数上限要求。
  • 查看检索结果的排序逻辑,确认与焦炭核心指标相关的内容优先展示,排序不以原始相似度为唯一依据。
  • 检查单条引用的内容长度,确认未超出预设的上下文窗口限制,避免出现内容截断或溢出。

问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。