焦炭投研知识库建设的数据库与运维

焦炭的行业数据主要来自中国煤炭工业协会、沿海港口现货报价系统、大连商品交易所及钢厂采购台账。现货报价每日收盘后更新,期货交易数据随交易时段实时同步,行业供需

这个品类的数据长什么样

焦炭的行业数据主要来自中国煤炭工业协会、沿海港口现货报价系统、大连商品交易所及钢厂采购台账。现货报价每日收盘后更新,期货交易数据随交易时段实时同步,行业供需报告每旬更新。结构化数据单条包含采样日期、产地、交割等级、含税出厂价、港口平仓价、库存总量等字段,价格单位为元/吨,库存单位为万吨;非结构化研报则包含供需分析、政策解读内容,单篇篇幅多在3000-8000字区间。

这些特征在「数据库与运维」这一环带来什么约束

高频实时的期货与现货数据会带来高并发写入压力,需要配置数据分片与读写分离机制。多来源的结构化与非结构化数据并存,要求数据库支持混合存储与统一的字段映射规则。长文本研报的存储需要适配大文档块的向量索引配置,避免分段召回丢失上下文。不同更新频率的数据需通过分库或定时任务隔离调度,防止低频率任务占用高写入资源。同时,焦炭交割等级、价格单位等字段需严格校验,避免非标准数据写入导致知识库检索偏差。

配置怎么定

配置项建议取法这样取的依据
PARSE_FILE_TIMEOUT_SECONDS900 秒焦炭研报单篇多在3000-8000字,常规解析超时时间不足,需延长至900秒确保完整解析
UPLOAD_FILE_MAX_SIZE2000 MB单篇焦炭研报加上关联的现货数据表格,总文件大小可达1.5GB左右,需放宽上传上限避免导入失败
向量数据库分片数8–12 分片高频写入的现货/期货数据与低频研报数据混合存储,分片数适配并发写入与检索的负载均衡
召回条数前 8 条焦炭投研需兼顾宏观政策、现货价格、期货走势多维度数据,8条召回可覆盖核心信息且避免冗余
相似度阈值0.75–0.85焦炭相关的行业术语语义相似度较高,阈值过低会引入无关检索结果,过高则遗漏关联信息
MONGO_REPLICA_SET_ENABLED开启投研数据需保证写入一致性与高可用性,副本集可避免单点故障导致的数据丢失

本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。

容易做错的三处

  • 现象:导入焦炭现货数据的Excel文件时,界面提示“文件解析失败”,日志显示UPLOAD_FILE_MAX_SIZE_EXCEEDED。原因:未调整UPLOAD_FILE_MAX_SIZE参数,默认上传上限小于单份包含多日数据的Excel文件大小。
  • 现象:启动FastGPT服务时MongoDB报错“副本集未初始化”,无法正常启动。原因:未开启MONGO_REPLICA_SET_ENABLED配置,且未手动初始化副本集。
  • 现象:检索焦炭供需分析时,召回结果中混入大量无关的煤炭品类数据,结果条数超出预期。原因:召回条数设置过高,且相似度阈值未针对焦炭专属术语做调整。

怎么确认配好了

  • 执行单份焦炭研报的解析任务,核对解析完成时间是否符合预期,确认PARSE_FILE_TIMEOUT_SECONDS配置生效。
  • 上传包含多日现货数据的Excel文件,确认上传进度条走完且无格式报错,验证UPLOAD_FILE_MAX_SIZE配置是否合理。
  • 发起“焦炭港口库存”的检索请求,核对召回结果的相关性,调整相似度阈值与召回条数至符合业务需求的区间。
  • 查看MongoDB集群状态,确认副本集节点正常运行,验证MONGO_REPLICA_SET_ENABLED配置已生效。

问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。