这个品类的数据长什么样
城商行财报数据主要来自官方披露的年度报告、季度监管报送报表及内部经营台账。更新节奏分为三类:年度报告每年更新一次,季度监管报表每季度更新,内部经营台账每日同步更新。单份财报文档包含资产负债明细、经营损益明细、监管指标台账三个核心模块,每个模块下包含数十个明细字段,字段类型多为绝对数值类,单位以人民币元或万元为主,无复杂嵌套子文档结构。
这些特征在「工作流编排」这一环带来什么约束
多源数据的接入需求带来了数据源配置的差异化约束:需分别配置年度报告、季度监管报表、内部经营台账的拉取触发规则,避免重复拉取或遗漏更新。明细字段数量较多,要求工作流中需配置精准的字段映射规则,确保提取的财报数据与后续分析模型的输入字段完全匹配。单位以人民币元或万元为主,需在工作流中加入统一单位转换节点,避免分析过程中出现数值量级偏差。无复杂嵌套子文档结构,简化了文档解析环节的配置,但需适配不同数据源的格式差异。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
trigger_rule | {"annual": "0 0 30 4 *", "quarterly": "0 0 15 1,4,7,10 *", "real_time": "*/10 * * * *"} | 匹配城商行年报4月30日前披露、季后15日内披露季报、内部台账每10分钟同步的更新节奏 |
field_mapping_list | 按资产负债/损益/监管台账三个模块分组,匹配字段名完全一致 | 财报明细字段数量较多,完全匹配可避免提取错误数据 |
unit_convert_factor | 10000 | 多数财报字段以万元为统计单位,转换为统一的元单位需乘以该系数 |
parse_chunk_size | 800–1200 字符 | 财报文档无复杂嵌套,该分段长度适配大段文本的解析与分析 |
recall_top_k | 前 10 条 | 城商行财报单份文档信息量较大,召回适量条目可兼顾分析精度与效率 |
similarity_threshold | 0.75 | 过滤低相关性的财报片段,避免无关内容干扰分析结果 |
global_var_kb_id | 按当前数据源类型动态赋值 | 不同财报数据源对应独立知识库,动态赋值可精准调用对应知识库 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:工作流运行后知识库检索无匹配内容,或返回
知识库未找到匹配文档的报错文案。原因:未正确配置global_var_kb_id的动态赋值规则,误填入固定知识库ID,未按数据源类型匹配对应的ID,导致调用了未关联对应财报数据的知识库。 - 现象:工作流解析节点超时,返回
PARSE_FILE_TIMEOUT错误码。原因:未设置合理的parse_chunk_size参数,未对长文本财报文档做拆分处理,导致单段文本超出解析节点的最大处理限制。 - 现象:提取的财报字段数值出现量级偏差,部分字段数值为元、部分为万元。原因:未配置
unit_convert_factor,未对不同数据源的统计单位做统一转换,导致分析过程中数值计算错误。
怎么确认配好了
- 触发一次手动运行工作流,检查各数据源的拉取结果是否与预期一致,核对字段数量与模块分类是否匹配。
- 查看
global_var_kb_id的赋值日志,确认不同数据源运行时调用的知识库ID是否正确匹配。 - 提取单份财报文档的数值字段,核对单位转换后的结果是否符合统一量级要求。
- 运行AI对话模块,输入预设的财报分析问题,检查返回结果是否基于正确的字段数据生成。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。