这个品类的数据长什么样
光伏财报分析的数据主要来自上市公司公开披露的定期报告、临时公告,以及行业公开的业务统计信息。披露节奏遵循证券监管要求:年度报告需在次年4月底前完成披露,半年度报告为8月底前,季度报告为季后10日内,临时公告如业绩预告、重大项目公告则随事件触发更新。文档以PDF格式为主,结构包含标准化财务报表、经营情况讨论与分析、业务数据专项说明等部分。字段除通用财务指标外,包含光伏行业特有的装机容量、组件出货量、硅料采购量、电站项目进度等,单位涵盖GW、MW、万元、元等,部分临时公告会披露单季度细分业务的细分数据。
这些特征在「模型接入与配置」这一环带来什么约束
光伏财报的多格式PDF文档、跨页结构化表格与行业特有的业务字段,要求模型接入时配置适配长文本的上下文窗口,避免截断核心业务数据。定期披露的固定节奏,要求配置定时任务触发的批量模型调用,适配不同披露周期的任务调度。行业特有的非标准化业务指标,要求在模型配置中添加自定义实体提取规则,避免通用模型无法识别细分业务字段。此外,PDF表格常存在跨页、合并单元格的情况,要求解析模块配置专属的表格识别模式,提升结构化数据的提取准确率。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
maxContext | 12000–16000 token | 单份光伏年报的核心业务与财务文本长度通常超过8000 token,避免关键数据被截断 |
PARSE_PDF_TABLE_MODE | 跨页合并识别 | 光伏财报的产能、出货量表格常跨页排版,该模式可完整提取跨页表格数据 |
UPLOAD_FILE_MAX_SIZE | 800 MB | 部分光伏企业年报PDF文件体积可达500–700 MB,预留足够上传空间 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 长财报的结构化解析耗时较长,避免提前终止解析流程 |
RECALL_TOP_K | 前 8–10 条 | 光伏财报的业务数据分散在经营讨论、财务附注等多个章节,需召回足够上下文 |
PROXY_TIMEOUT | 300 秒 | 批量调用模型处理多份财报时,单次请求的总耗时需覆盖解析与模型推理环节 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象为调用ollama模型时返回空结果或无响应,原因是未在docker启动参数中配置ollama服务的本地网络互通权限,导致FastGPT容器无法访问ollama的本地端口。
- 现象为模型无法识别光伏财报中的装机量、出货量等行业特指标,原因是未配置自定义实体提取的prompt规则,通用模型无法区分通用财务字段与光伏行业特有的业务指标。
- 现象为批量处理多份财报时出现超时错误,原因是未调整
PARSE_FILE_TIMEOUT_SECONDS参数,默认超时时间不足以完成长财报的解析与模型调用。
怎么确认配好了
- 上传单份光伏企业年报PDF,执行解析操作,核对解析结果是否覆盖经营讨论、财务报表、业务数据等核心章节,确认解析配置生效。
- 在模型测试界面输入包含光伏行业特指标的查询,调用配置的模型,核对返回结果是否准确提取目标字段,确认实体识别规则配置正确。
- 启动单份财报的模型调用任务,查看任务日志与返回结果,确认无超时、空结果等异常,核对网络与超时配置。
- 批量导入多份光伏财报文件,执行批量处理任务,确认所有任务均正常完成,确认批量调用参数配置合理。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。