焦煤投研知识库建设的向量模型与索引

焦煤投研数据主要来源于行业协会月度供需报告、期货交易所交割日报、矿山生产周报、现货市场每日报价及专业研报。数据更新节奏存在差异:现货报价与交割数据每日更新,

这个品类的数据长什么样

焦煤投研数据主要来源于行业协会月度供需报告、期货交易所交割日报、矿山生产周报、现货市场每日报价及专业研报。数据更新节奏存在差异:现货报价与交割数据每日更新,行业供需报告按月度或季度发布,政策文件随调控节点随机更新。文档结构包含结构化表格、纯文本研报正文及政策通知文件,核心字段包含焦煤牌号、产地、统计周期,单位涵盖元/吨、万吨等。

这些特征在「向量模型与索引」这一环带来什么约束

焦煤数据的多来源、多结构与差异化更新节奏,对向量模型与索引配置提出明确约束。分散的结构化与非结构化数据混合,要求索引支持多模态内容的统一嵌入与检索;不同更新频率的数据源,需要适配差异化的索引刷新策略,避免实时数据滞后或定期数据冗余;专业术语与专属字段,要求向量模型具备行业语义捕获能力,同时索引需支持按核心字段过滤,排除无关品类的煤炭数据。

配置怎么定

配置项建议取法这样取的依据
chunk_size800–1200 字符焦煤研报正文多包含长句数据说明,该长度可保留单段内的供需逻辑完整性,避免拆分破坏数据关联
chunk_overlap100–150 字符平衡分段间的上下文衔接,防止价格、牌号等核心信息被拆分至不同分段
embedding_modeltext-embedding-3-large(或同维度开源模型)焦煤数据包含专业术语与结构化字段,高维度模型可更好捕获行业专属语义与字段关联
recall_top_k前 8–12 条焦煤投研需兼顾供需、价格、政策多维度信息,该召回量可覆盖多场景参考依据
filter_fields焦煤牌号, 产地, 统计周期匹配投研场景的核心筛选维度,过滤非目标品类的煤炭数据
index_refresh_interval实时(现货数据)+ 每日(报告数据)适配不同数据源的更新节奏,确保实时数据与定期报告的索引一致性

本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。

容易做错的三处

  • 现象:知识库返回与提问无关的非焦煤煤炭数据,界面展示的召回结果包含无烟煤、动力煤内容。原因:未配置filter_fields过滤非目标品类字段,索引未按焦煤专属维度做筛选。
  • 现象:索引状态显示未就绪,无法触发知识库检索,后台日志返回504 Gateway Timeout。原因:未设置适配焦煤批量数据的index_refresh_interval,全量索引刷新超时导致状态未更新。
  • 现象:将整个数据表直接作为知识库导入,检索结果包含大量无关联的冗余字段内容。原因:未对结构化数据表做字段筛选与分段处理,直接导入全量原始数据导致向量嵌入冗余。

怎么确认配好了

  • 执行单次检索测试,输入包含焦煤牌号的提问,核对召回结果的source字段是否仅包含焦煤相关文档。
  • 查看索引管理界面的状态标识,确认index_ready字段返回true,或界面显示索引已就绪。
  • 导入单条结构化数据表,检查嵌入后的分段是否保留了核心字段与数据关联,无强制拆分破坏逻辑。
  • 调整recall_top_k参数后,验证检索结果的条数匹配配置的取值范围。

问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。