这个品类的数据长什么样
焦煤投研数据主要来自国家能源局、中国煤炭工业协会、主产区地方工信部门、大连商品交易所及第三方大宗商品资讯平台。更新节奏覆盖日度现货报价、周度港口库存、月度产量与进口数据、季度行业分析报告。文档包含结构化时序表(csv/excel)、带图表的PDF研报、实时API接口数据。字段包含交割品级(主焦煤/1/3焦煤)、灰分、硫分、粘结指数G值、胶质层厚度Y值,单位多为元/吨、万吨、%。
这些特征在「引用来源与溯源」这一环带来什么约束
焦煤数据的多维度结构化特征要求溯源时需精准匹配字段维度,避免泛化召回;高频更新的数据源要求配置定期刷新机制,确保引用数据的时效性;不同来源文档的字段命名差异(如灰分标注为Ad或干基灰分)需统一映射,否则溯源无法精准关联数据;长文档研报的多组关联数据(如产地报价+库存+期货走势)要求分段时保留上下文,否则引用溯源会割裂数据逻辑;投研场景对数据发布时间的强需求,要求溯源信息需包含发布机构与时间,不能仅包含文件名。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
召回条数 | 前8-12条 | 焦煤投研需覆盖多维度数据(报价、库存、期货、分析),足够的召回条数可支撑完整结论,避免信息缺失 |
相似度阈值 | 0.75-0.85 | 焦煤与动力煤等同大类品类术语相近,阈值过低会引入混淆数据,过高则会丢失有效关联内容 |
分段长度 | 1000-1500字符 | 焦煤研报常包含多组关联数据段落,分段过长会丢失上下文关联,过短会割裂数据逻辑 |
PARSE_FILE_TIMEOUT_SECONDS | 600秒 | 大型焦煤月度分析报告包含复杂图表与多页数据,需足够时间完成结构化解析与字段提取 |
引用来源展示字段 | ["报告标题", "发布机构", "发布时间", "文档路径"] | 投研人员需明确溯源的核心信息,仅文件名无法满足精准追溯数据来源的需求 |
上下文召回排序方式 | 按相关性+发布时间加权 | 焦煤数据时效性强,近期现货与期货数据比旧研报更具参考价值,加权排序可优化引用优先级 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:返回的引用条目排序与预设的相关性排序不一致。原因:未配置按相关性+发布时间加权的排序方式,仅按原始召回顺序返回。
- 现象:API调用返回结果中
source_info字段为空或未包含文件名。原因:未开启引用来源导出配置,或未在引用来源展示字段中指定文件名相关参数。 - 现象:仅能选中单个文档片段作为引用源,无法合并多段关联数据。原因:未启用多片段召回合并配置,或分段长度设置过短导致片段关联失效。
怎么确认配好了
- 上传一份焦煤现货报价文档,触发查询后查看引用来源模块,确认是否包含报告标题、发布机构、发布时间与文档路径信息。
- 调用API接口,检查返回结果中是否存在
source_info字段,且字段内包含文件名与对应数据维度。 - 上传一份动力煤相关文档,调整相似度阈值至0.78,测试是否能过滤非焦煤品类的召回结果。
- 上传包含多组关联数据的焦煤研报,测试是否能召回多个关联片段并合并展示为完整引用源。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。