这个品类的数据长什么样
焦煤财报数据主要来自上市焦煤企业的金融披露定期财报、国内煤炭行业协会的月度产销统计报告、港口焦煤现货交易台账。更新节奏分为季度级的企业财报、月度级的行业供需数据。单份文档结构包含生产规模、销售均价、库存水平、下游钢铁行业联动数据等字段,核心指标单位包括吨、元/吨、百分比,部分文档附带焦煤品质分级参数如干基灰分、硫分数值。
这些特征在「向量模型与索引」这一环带来什么约束
焦煤财报的多来源、分层更新的特征,对向量模型与索引环节带来多重约束。季度级企业财报与月度级行业数据的更新节奏差异,要求索引支持增量同步机制,避免全量重建带来的计算开销。财报包含生产、价格、品质等多维度细分字段,需要向量模型适配多字段混合编码,处理纯文本内容之外的结构化指标。单份文档长度较长且附带附表,需要设置合理的分段阈值,避免关键指标被拆分至不同片段中。不同来源的数据格式存在差异,需要统一预处理流程后再进入索引环节,降低检索噪声。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
EMBEDDING_MODEL | bge-large-zh-v1.5(适配v4.8.21-fix版本) | 适配中文煤炭行业专业术语,可准确编码焦煤相关的细分指标描述 |
CHUNK_SIZE | 800–1200 字符 | 焦煤财报包含长文本的指标说明与附表内容,该区间可保留指标间的关联性 |
RECALL_TOP_K | 前 8–12 条 | 焦煤财报的核心指标分布集中,过多召回会引入无关的非核心数据 |
SIMILARITY_THRESHOLD | 0.72–0.85 | 匹配焦煤专业指标的语义相似度区间,过滤低相关的召回结果 |
INDEX_INCREMENTAL_SYNC | 开启 | 适配焦煤数据分季度、月度的更新节奏,减少全量索引重建的计算量 |
PARSE_FIELD_WHITELIST | ["产量","均价","库存","灰分","硫分"] | 过滤非核心字段,减少向量编码的冗余信息,聚焦财报关键内容 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:向量检索结果匹配度低,核心焦煤指标未被召回。原因:选用了仅适配通用中文语料的嵌入模型,未针对煤炭行业专业术语做优化。
- 现象:导出的知识库dataset.csv仅包含index字段,无content字段内容。原因:未开启索引内容的持久化存储配置,或解析阶段未正确提取文档原始内容字段。
- 现象:Docker容器内索引模型无法正常加载,启动时报错
500 Internal Server Error。原因:未在docker-compose.yml中挂载索引模型的本地缓存目录,或OneAPI配置的模型接口未开放容器访问权限。
怎么确认配好了
- 查看FastGPT的向量模型管理界面,确认已选中的嵌入模型与配置项中
EMBEDDING_MODEL的取值一致,且适配当前部署的v4.8.21-fix版本的配置规范。 - 上传一份测试用的焦煤财报文档,检查解析后的分段结果是否符合
CHUNK_SIZE的设置区间,无过度拆分的核心指标片段。 - 执行一次知识库召回测试,核对返回的召回条数与
RECALL_TOP_K的设置匹配,且相似度结果符合预设阈值范围。 - 导出知识库的dataset.csv文件,确认content字段已包含文档的原始文本内容,无空值情况。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。