这个品类的数据长什么样
动力煤数据来源包括国家能源局煤炭司公开统计、主要港口实时调度数据、煤炭生产企业月度产能公告、下游电力与钢铁行业采购需求公示。更新节奏差异明显:国家能源局数据为月度更新,港口装卸数据为每日更新,期货挂牌价格为实时更新,企业产能公告为不定期更新。文档多为结构化表格,包含矿点标识、发热量、全硫含量、灰分、产地、到港时间、货权归属等字段,发热量单位为兆焦/千克,全硫含量单位为克/千克,货重单位为吨。
这些特征在「知识库检索与召回」这一环带来什么约束
数据源分散且更新频率不一,需设置多源差异化同步任务,避免召回过时数据。结构化文档字段多样且单位不统一,需在预处理阶段统一单位与字段格式,避免检索时因单位或字段名差异匹配失败。下游尽调报告需精准匹配特定矿点、时间窗口的参数,需结合元数据的时间、产地维度配置过滤规则,缩小检索池范围。实时类数据对新鲜度要求高,需高频同步向量库,静态类数据可低频更新以节省资源。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
召回条数 | 前20条 | 动力煤数据字段多且分散,初始召回足够数量的候选结果可覆盖全量相关维度,避免遗漏关键矿点或时间窗口数据。 |
相似度阈值 | 0.72–0.78 | 动力煤相关术语语义相似度较高,阈值过低会引入无关结果,过高会过滤有效匹配内容。 |
重排返回条数 | 前5条 | 智能尽调报告需精准核心数据,5条结果可满足多维度交叉验证需求,同时控制报告篇幅。 |
分段长度 | 800–1200字符 | 动力煤结构化文档多为表格拆分后的段落,该长度可保留单份交割单、产能公告的完整信息单元。 |
向量库同步周期 | 实时同步港口数据、月度同步静态产能数据 | 港口数据时效性要求高,静态产能数据更新频率低,差异化同步可平衡资源占用与数据新鲜度。 |
元数据过滤规则 | 按doc_type、publish_time字段过滤 | 动力煤数据按文档类型与发布时间区分有效范围,可精准缩小检索池,提升检索效率。 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:重排模型返回结果为
false,检索结果无有效重排内容。原因:tei部署的bge-reranker模型未正确加载权重,或输入的候选结果数量超出模型支持的最大序列长度。 - 现象:API调用与在线聊天的检索结果差异显著。原因:在线聊天默认启用会话上下文关联,而API调用未配置会话参数,导致检索时未结合用户历史查询的上下文过滤。
- 现象:元数据过滤未生效,召回结果包含非目标品类的文档。原因:误将元数据过滤配置为过滤检索后结果,未配置为过滤知识库源数据,导致无关文档先被召回再被跳过,未起到缩小检索池的作用。
怎么确认配好了
- 执行单源数据检索测试,核对召回结果的字段与目标文档的字段是否匹配。
- 调用重排接口,查看返回结果的排序与相关性是否符合预期,确认重排模型正常加载。
- 配置元数据过滤规则后,检索非目标品类的关键词,验证是否无相关结果召回。
- 对比API调用与在线聊天的检索参数,确认两者的召回、重排配置一致。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。