这个品类的数据长什么样
普钢财报数据主要来自境内外证券交易所披露的年度报告、季度报告及临时公告,辅以行业协会发布的月度运行数据。数据更新节奏分为固定周期与临时触发:固定周期为年度、季度披露,临时公告触发频率不定。文档以PDF格式为主,年报单份页数差异较大,建议按自有样本统计或实测后再定,包含产量、营收、原材料成本占比、吨钢利润、产能利用率等核心字段,单位多为万吨、亿元、元/吨。
这些特征在「部署与升级」这一环带来什么约束
普钢财报的大体积、长文档结构要求调整文件上传与解析的基础配置,避免超时或解析失败。多字段的定制化抽取需求,需要提前配置专属的字段匹配规则,避免通用抽取遗漏行业特有指标。不同更新频率的数据源,要求设置分层的定时同步策略,兼顾常规财报与临时公告的及时性。版本升级时需兼容不同格式的财报文件,避免旧版本解析规则无法适配新披露的财报结构。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 普钢年报PDF单份页数超100页,通用解析时长不足 |
UPLOAD_FILE_MAX_SIZE | 1000 MB | 包含附件的完整年报包体积较大 |
maxContext | 8000–12000 字符 | 普钢财报包含长段的成本结构分析,需保留足够上下文 |
召回条数 | 前 10 条 | 普钢财报关联字段较多,需召回足够相关片段 |
相似度阈值 | 0.75 | 普钢行业术语集中度高,避免召回无关的通用行业数据 |
DEFAULT_LANGUAGE | zh-CN | 匹配国内用户的界面使用习惯 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:升级至v4.8.22后重新拉取镜像,登录时报错500状态码。原因:未在docker-compose.yml中正确配置
JWT_SECRET环境变量,导致会话校验失败。 - 现象:上传普钢财报后,核心字段
吨钢利润未被正确提取。原因:未开启自定义字段抽取规则,通用解析模型未匹配到普钢财报特有的利润计算字段。 - 现象:完成知识库牵引后,界面语言从中文变为英文。原因:未在部署配置中设置
DEFAULT_LANGUAGE=zh-CN,系统默认加载英文语言包。
怎么确认配好了
- 上传一份公开披露的普钢上市公司年报PDF,检查解析任务在10分钟内完成,无超时报错日志。
- 发起一次财报分析查询,确认
吨钢利润、产能利用率等预设字段可被正常提取并返回。 - 查看docker容器运行日志,无
PARSE_FILE_TIMEOUT、UPLOAD_FILE_SIZE_EXCEED相关报错信息。 - 切换界面语言设置,确认重启服务后界面保持中文显示,无牵引后语言变更的情况。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。