这个品类的数据长什么样
焦煤财报数据主要来自三类渠道:国内焦煤生产企业的季度、年度公开财报,中国煤炭运销协会发布的月度焦煤供需报告,以及上海期货交易所的焦煤期货交割库存周报。数据更新节奏存在差异:企业财报按季度、年度更新,行业供需报告按月度更新,期货库存周报按周更新。单份企业财报文档结构包含资产负债表、利润表、焦煤业务营收占比、单位成本、产量、销量等字段,字段单位多为元/吨、万吨;行业报告则包含分区域产量、进口量、市场均价等字段,格式多为结构化表格加文字分析。
这些特征在「部署与升级」这一环带来什么约束
多数据源的更新节奏差异要求部署时配置差异化的定时同步规则,避免无效同步占用资源。焦煤财报包含大量行业专属术语与结构化字段,需要在知识库配置中开启自定义字段抽取规则,确保专业信息被正确识别。单份企业财报的审计附件可能长达数十页,会增加文档解析的时间与资源消耗,需要调整解析相关的配置参数。此外,不同数据源的访问权限与格式差异,要求部署时配置多套接入规则,适配企业财报的公告页面、行业报告的下载接口等不同来源的获取逻辑。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 焦煤企业年度财报的审计附件单份长度可达50页以上,默认超时时间不足以完成完整解析 |
UPLOAD_FILE_MAX_SIZE | 1000 MB | 单份年度财报的配套审计报告可能超过默认的200MB限制,需适配大体积文档上传 |
maxContext | 800–1200 字符 | 焦煤财报专业术语密集,较长的上下文可保留业务关联信息,提升检索准确性 |
召回条数 | 前 8 条 | 焦煤财报的相关字段分散在不同章节,更多召回结果可覆盖完整的业务信息 |
相似度阈值 | 0.75–0.85 | 焦煤行业术语语义相似度较高,较高阈值可避免无关文档被误召回 |
定时同步间隔 | 按数据源类型区分,周度数据每7天,季度数据每90天 | 匹配不同来源数据的实际更新频率,减少无效同步操作 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:执行源码部署脚本时出现
npm install失败,提示ENOSPC或依赖包版本不兼容。原因:未调整系统文件句柄限制,且未指定FastGPT源码部署的依赖缓存路径,导致大体积的焦煤财报解析依赖包下载失败。 - 现象:执行
docker build构建镜像时输出WARNING: current commit information was not captured by the,且镜像启动后无法加载本地知识库。原因:未在项目目录初始化git仓库,导致构建脚本无法获取版本信息,镜像内的知识库索引路径配置异常。 - 现象:对接FunASR进行财报文档的语音转写后,返回结果中焦煤相关专业术语(如“主焦煤”“肥煤”)缺失或识别错误。原因:未导入焦煤行业专属的专业词表,导致模型无法正确识别领域术语。
怎么确认配好了
- 上传一份焦煤企业的季度财报PDF,检查解析后文本是否包含焦煤产量、单位成本等专属字段,且无明显截断。
- 执行一次配置好的定时同步任务,查看知识库中新增的文档数量与更新频率匹配,无重复或遗漏的数据源内容。
- 发起一条焦煤财报相关的查询,检查召回结果的数量符合配置的召回条数,且相似度符合设定阈值。
- 调用FunASR转写接口,验证返回的
transcript字段包含焦煤专业术语,无明显识别错误。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。