动力煤智能尽调报告的向量模型与索引

动力煤品类的数据源包含行业协会公开统计数据、港口装卸监测台账、铁路/海运货运记录、下游用能企业报送数据及行业政策文件。数据更新节奏存在差异:现货报价类数据日

这个品类的数据长什么样

动力煤品类的数据源包含行业协会公开统计数据、港口装卸监测台账、铁路/海运货运记录、下游用能企业报送数据及行业政策文件。数据更新节奏存在差异:现货报价类数据日度更新,月度供需简报月更,行业政策文件按需发布。文档结构覆盖多类型:结构化的现货报价表、半结构化的月度供需报告、非结构化的政策解读文本。常规字段包含产地编码、发热量、全水分、灰分、运输链路信息,其中发热量单位为兆焦/千克,水分含量单位为千克/吨。

这些特征在「向量模型与索引」这一环带来什么约束

多源异构的数据源要求向量处理链路支持结构化、半结构化、非结构化数据的统一抽取,避免单一切分逻辑破坏业务语义。差异化的更新节奏要求索引系统支持增量同步与全量同步的灵活切换,适配日度数据的实时更新与月度报告的批量处理。字段的单位与含义差异要求先完成标准化映射,否则向量相似度计算会受单位不统一的干扰。文档长度跨度大的特征要求切分策略具备自适应能力,避免短文档过度切分或长文档语义断裂。跨文档的关联分析需求要求索引支持多字段联合召回,覆盖产地、运输、需求等维度的关联数据。

配置怎么定

配置项建议取法这样取的依据
PARSE_DOC_SPLIT_SIZE800–1200 字符适配动力煤短报价单与长报告的混合文档,避免切分破坏业务语义
VECTOR_MODEL_NAMEbge-large-zh-v1.5适配动力煤行业专业术语,提升语义对齐效果
INDEX_INCREMENTAL_SYNC开启适配日度更新的现货数据,减少全量索引的耗时
RECALL_TOP_K前10条覆盖尽调所需的多维度关联数据,避免召回过多冗余信息
PARSE_FILE_MAX_SIZE2000 MB支持包含大量图表的月度行业报告上传
EMBEDDING_BATCH_SIZE32平衡批量处理的内存占用与速度,适配十万级数据量的向量生成

本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。

容易做错的三处

  • 现象:上传csv格式的动力煤报价数据后,向量完成后入库数据总量少于源文件行数。原因:csv文件中存在空行或格式异常的行,解析环节自动过滤了无效数据,导致向量入库条数缺失。
  • 现象:向量索引创建返回成功,但页面始终显示索引未建立。原因:Docker部署环境中,向量服务的存储目录未正确挂载到宿主机,或目录无写入权限,导致索引文件无法持久化。
  • 现象:本地运行向量索引流程正常,打包为Docker镜像运行后,多次生成的向量得分完全一致。原因:Docker镜像未挂载模型缓存目录,每次启动都重新下载并初始化向量模型,导致生成的向量未复用上下文,出现固定结果。

怎么确认配好了

  • 上传单篇短文档(如单日现货报价单),检查向量生成结果的字段完整性,确认切分未破坏产地、发热量等核心业务字段的语义。
  • 导入十万条结构化的动力煤数据,对比源文件行数与向量入库条数,确认无异常数据过滤。
  • 启动Docker容器后,访问向量服务的健康检查接口,确认索引存储路径具备写入权限。
  • 导入不同长度的文档,多次生成向量并对比结果,确认模型缓存已正确挂载,避免重复初始化模型。

问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。