这个品类的数据长什么样
焦煤投研数据主要来源于行业协会月度供需报告、期货交易所交割日报、矿山生产周报、现货市场每日报价及专业研报。数据更新节奏存在差异:现货报价与交割数据每日更新,行业供需报告按月度或季度发布,政策文件随调控节点随机更新。文档结构包含结构化表格、纯文本研报正文及政策通知文件,核心字段包含焦煤牌号、产地、统计周期,单位涵盖元/吨、万吨等。
这些特征在「向量模型与索引」这一环带来什么约束
焦煤数据的多来源、多结构与差异化更新节奏,对向量模型与索引配置提出明确约束。分散的结构化与非结构化数据混合,要求索引支持多模态内容的统一嵌入与检索;不同更新频率的数据源,需要适配差异化的索引刷新策略,避免实时数据滞后或定期数据冗余;专业术语与专属字段,要求向量模型具备行业语义捕获能力,同时索引需支持按核心字段过滤,排除无关品类的煤炭数据。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
chunk_size | 800–1200 字符 | 焦煤研报正文多包含长句数据说明,该长度可保留单段内的供需逻辑完整性,避免拆分破坏数据关联 |
chunk_overlap | 100–150 字符 | 平衡分段间的上下文衔接,防止价格、牌号等核心信息被拆分至不同分段 |
embedding_model | text-embedding-3-large(或同维度开源模型) | 焦煤数据包含专业术语与结构化字段,高维度模型可更好捕获行业专属语义与字段关联 |
recall_top_k | 前 8–12 条 | 焦煤投研需兼顾供需、价格、政策多维度信息,该召回量可覆盖多场景参考依据 |
filter_fields | 焦煤牌号, 产地, 统计周期 | 匹配投研场景的核心筛选维度,过滤非目标品类的煤炭数据 |
index_refresh_interval | 实时(现货数据)+ 每日(报告数据) | 适配不同数据源的更新节奏,确保实时数据与定期报告的索引一致性 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:知识库返回与提问无关的非焦煤煤炭数据,界面展示的召回结果包含无烟煤、动力煤内容。原因:未配置
filter_fields过滤非目标品类字段,索引未按焦煤专属维度做筛选。 - 现象:索引状态显示未就绪,无法触发知识库检索,后台日志返回
504 Gateway Timeout。原因:未设置适配焦煤批量数据的index_refresh_interval,全量索引刷新超时导致状态未更新。 - 现象:将整个数据表直接作为知识库导入,检索结果包含大量无关联的冗余字段内容。原因:未对结构化数据表做字段筛选与分段处理,直接导入全量原始数据导致向量嵌入冗余。
怎么确认配好了
- 执行单次检索测试,输入包含焦煤牌号的提问,核对召回结果的
source字段是否仅包含焦煤相关文档。 - 查看索引管理界面的状态标识,确认
index_ready字段返回true,或界面显示索引已就绪。 - 导入单条结构化数据表,检查嵌入后的分段是否保留了核心字段与数据关联,无强制拆分破坏逻辑。
- 调整
recall_top_k参数后,验证检索结果的条数匹配配置的取值范围。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。