这个品类的数据长什么样
焦煤相关数据来源包括国内焦煤行业协会公开资料、大连商品交易所焦煤期货交割标准文档、现货贸易商每日报价台账、矿山企业月度生产简报、海关总署进出口通关数据。更新节奏为:现货报价每日更新,期货交割标准每1至2年修订,生产简报每周更新,进出口数据每月更新。文档分为三类:结构化表格文档,包含产地、报价、核心质量参数等字段;非结构化研报文档,包含供需分析、政策解读内容;标准化指标说明文档,明确焦煤质量要求。字段及单位包括:报价单位为元/吨,粘结指数为无量纲数值,硫含量为毫克/千克,灰分含量为克每千克。
这些特征在「知识库检索与召回」这一环带来什么约束
焦煤数据的多来源与差异化更新节奏,要求检索系统支持按更新时间过滤召回结果,适配每日增量更新的现货报价数据。结构化表格文档包含明确的业务字段,要求检索支持字段级精准匹配,例如针对产地、粘结指数的条件检索。非结构化研报内容篇幅较长,要求分段策略适配专业术语的完整性,避免割裂核心分析逻辑。核心质量参数为行业通用检索关键词,要求召回模型优先匹配这些专业字段,同时覆盖泛化文本的检索需求。此外,标准化指标文档的固定格式,要求检索系统可识别并提取其中的参数阈值,用于结果校验。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
召回条数 | 前20条 | 焦煤数据包含结构化报价、质量参数、研报等多类内容,足够的候选集可覆盖不同业务场景的检索需求 |
相似度阈值 | 0.72–0.80 | 焦煤专业术语的语义相似度较高,阈值过低会引入无关结果,过高会遗漏相关行业数据 |
分段长度 | 800–1200 字符 | 非结构化研报内容篇幅较长,该分段长度可保证专业术语的上下文完整性,避免语义割裂 |
增量更新触发间隔 | 每日凌晨2点 | 现货报价数据每日更新,该配置可保证知识库数据的时效性,同时避免全量更新的资源消耗 |
重排返回条数 | 前8条 | 焦煤投研需兼顾多维度数据,返回过多会超出上下文窗口,过少会遗漏关键分析内容 |
字段匹配权重 | 0.3–0.5 | 结构化字段的精准匹配需与语义检索结合,该权重区间可平衡精准匹配与泛化检索的效果 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 检索结果中出现大量非焦煤相关的煤炭品类数据,原因:未配置字段级过滤规则,未限定检索范围为焦煤专属数据。
- 知识库返回的内容与用户问题不匹配,例如提问“焦煤港口报价”却返回矿山生产数据,原因:相似度阈值设置过低,引入了低相关的语义匹配结果,或分段长度设置不合理导致上下文丢失。
- 开启重排模型后,召回结果仅返回相似度最高的1条内容,原因:错误配置了
重排返回条数为前1条,未设置为适配焦煤数据的合理区间。
怎么确认配好了
- 上传焦煤专属数据后,查看知识库的更新日志,确认增量更新任务按预设间隔触发。
- 发起针对焦煤质量参数的检索,核对检索结果是否包含字段级过滤后的相关内容,确认字段匹配权重配置生效。
- 测试重排模型开启前后的召回结果条数,确认
重排返回条数的配置与预期一致。 - 输入泛化的煤炭品类问题,核对检索结果是否仅返回焦煤相关数据,确认过滤规则配置正确。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。