这个品类的数据长什么样
证券财报数据主要来自境内外证券交易所公开披露平台,更新节奏为季度(季报)、半年度(半年报)、年度(年报)固定周期,临时公告则随重大事项触发。文档以PDF格式为主,结构包含封面、目录、审计报告、核心财务报表及详细附注。字段包含归母净利润、每股收益、净资产收益率等财务指标,单位统一为元、万元或亿元,部分字段附带同比环比标识。
这些特征在「工作流编排」这一环带来什么约束
证券财报的固定周期披露要求工作流需配置定时触发节点,适配披露时段;PDF格式的非结构化原始文档需启用结构化解析策略,避免仅提取纯文本导致的字段丢失;长文档结构要求工作流拆分分段处理节点,适配大模型上下文限制;固定的字段命名与单位要求工作流配置标准化映射规则,确保提取数据的准确性;临时公告的随机触发要求工作流支持手动触发与定时触发结合的模式。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PARSE_PDF_STRATEGY | 结构化字段提取+全文解析 | 证券财报包含固定结构化财务字段与详细附注文本,兼顾两者可完整提取核心数据 |
MAX_CONTEXT_LENGTH | 8000–12000 字符 | 单份年报附注部分篇幅较长,该区间可避免关键内容被截断 |
RECALL_TOP_K | 前3–5 条 | 证券财报核心数据集中在固定章节,过多召回会引入非核心的公告内容 |
WORKFLOW_TRIGGER_CRON | 0 0 10 1–5 | 适配境内财报披露的固定工作日时段,自动触发数据处理流程 |
HTTP_REQUEST_TIMEOUT | 600 秒 | 大模型处理长财报文本及多轮字段校验需要较长响应时间 |
VARIABLE_MAPPING_MODE | 按字段名精准匹配 | 证券财报字段命名固定,精准匹配可避免变量与非目标字段混淆 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:在工作流中传入
company_code变量调用知识库时,返回「知识库不存在」的报错文案。原因:未配置变量与知识库ID的映射规则,直接使用硬编码的知识库ID,导致变量未生效。 - 现象:工作流输出的财报数据单位混乱,同时出现元与万元的数值。原因:未配置单位标准化转换节点,直接提取原始文档中的字段值,未统一单位格式。
- 现象:工作流中
RECALL_TOP_K设置为「前8 条」后,返回结果包含非财务报表的公告内容。原因:未限定召回文档的分类标签,导致召回了与财报无关的临时公告。
怎么确认配好了
- 上传单份上市公司年报PDF,触发工作流,核对解析出的核心字段是否与原文一致。
- 传入预设的上市公司代码变量,核对工作流是否自动匹配到对应主体的知识库文档。
- 调整
MAX_CONTEXT_LENGTH的取值,核对长文本解析时是否出现截断或超时报错。 - 设置定时触发任务,核对指定时段是否自动启动工作流并生成对应报告。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。