这个品类的数据长什么样
证券财报数据主要来自境内外证券交易所的公开披露平台,更新节奏固定为季度报、年报的强制披露窗口期,重大经营事项会同步发布临时公告。文档结构包含结构化财务报表(资产负债表、利润表、现金流量表)与非结构化附注内容,字段涵盖每股收益、归母净利润、营收总额等核心指标,单位以元、万元、亿元为基础,跨市场披露的财报需区分人民币、港元等币种格式。
这些特征在「引用来源与溯源」这一环带来什么约束
证券财报的固定披露周期要求溯源信息需精准标注披露日期与交易所来源,避免混淆不同周期的财报数据。结构化字段密集的特性要求召回时需优先匹配精准关键词,避免引入无关财报片段。长篇幅的附注内容会导致分段与上下文窗口配置需适配长文本处理,防止字段关联断裂。跨币种与跨市场的财报格式差异,要求溯源信息需同时标注市场主体与单位类型,确保引用的可读性。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
rag_top_k | 前3-5条 | 证券财报字段密集,过多召回会导致上下文冗余,降低回答精准度 |
chunk_size | 800-1200字符 | 财报附注段落较长,分段过短会割裂字段关联,过长会超出上下文窗口限制 |
source_include_mark | 开启 | 需强制在回答中携带披露平台、披露日期、文档页码等溯源信息 |
parse_file_timeout_seconds | 600秒 | 单份年报PDF可能包含500页以上内容,解析耗时较长 |
similarity_threshold | 0.75-0.85 | 财报关键词匹配精度要求高,阈值过低会引入无关财报片段 |
enable_incremental_sync | 按季度开启 | 财报更新周期固定为季度/年度,增量同步可减少重复解析资源消耗 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 调用POST接口返回空content,排查发现接口关联的知识库未绑定证券财报数据源。原因是未将交易所披露的财报文件上传至对应知识库并完成索引,导致无有效召回内容。
- 引用展示出现乱码,部分财报附注的繁体字符或特殊符号丢失。原因是未开启PDF解析的OCR优化开关,或未指定适配财报格式的解析模板,导致解析过程中字符编码异常。
- 回答中召回超过5条不同财报的引用片段。原因是未设置
rag_top_k的合理阈值,或未开启按文档来源过滤的配置,导致无关财报内容被召回。
怎么确认配好了
- 上传单份A股年报PDF,查看解析后的分段是否按财报章节拆分,无明显段落割裂。
- 发起包含具体财报字段的查询,检查回答中是否携带披露日期、交易所来源等溯源信息。
- 配置增量同步后,等待季度财报披露窗口,查看知识库是否自动新增最新财报文档。
- 调整
similarity_threshold至0.8,验证低匹配度的无关财报片段不会被召回。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。