这个品类的数据长什么样
综合服务财报分析的数据来源包括公开披露的上市公司定期报告、挂牌公司公告,以及合作机构提供的企业内部管理报表。更新节奏以季度、年度定期更新为主,临时公告按需发布。文档结构包含标准化财务科目表格与非标准化附注说明,字段涵盖科目名称、期末余额、上年同期数等,单位多采用人民币元、万元,部分内部报表会自定义辅助统计字段。
这些特征在「文档解析与分块」这一环带来什么约束
公开披露的财报存在可编辑文档与扫描件两种格式,解析时需同时适配文本提取与OCR流程。临时公告的非固定更新节奏,要求解析环节支持增量同步与断点续传。标准化财务表格与非标准化附注混合存在,分块时需保留表格内字段的关联关系,避免拆分后科目与数值脱节。自定义辅助字段的多样性,要求解析规则具备灵活适配能力,无法通过固定模板覆盖全部场景。长文档的章节跨度大,分块长度需兼顾上下文连贯性,防止割裂财务指标的完整逻辑。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
parse_mode | auto | 适配可编辑文档与扫描件混合的场景,自动切换文本提取与OCR流程 |
chunk_size | 800–1200 字符 | 匹配财报单条财务逻辑的平均长度,兼顾检索精度与上下文完整性 |
chunk_overlap | 100–150 字符 | 避免跨块的财务指标被拆分,保留相邻块的关联信息 |
ocr_language | chi_sim+eng | 适配财报中中文科目与英文货币单位、专业术语混合的场景 |
enable_incremental_parse | true | 适配临时公告的非固定更新节奏,减少重复解析开销 |
parse_max_pages | 500 页 | 覆盖多数年度财报的页数范围,避免超长文档解析失败 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:扫描件财报解析后出现中文乱码,日志返回
OCR_ENGINE_ERROR状态码。原因:未配置ocr_language为中文混合模式,仅启用英文识别引擎。 - 现象:导入Excel格式的财报表格后,知识库中显示完整,但检索输出时表格结构丢失。原因:分块配置未启用表格结构保留规则,默认将表格转为纯文本拆分。
- 现象:检索返回的分块内容中,辅助统计字段的匹配结果排在核心财务指标之前。原因:分块时未对核心科目段落设置关联权重,或检索配置未调整字段优先级。
怎么确认配好了
- 上传单页扫描件财报,查看解析结果的中文文本是否完整,验证
ocr_language配置是否生效。 - 上传完整年度财报PDF,检查分块后的结果是否保留财务表格的结构,验证
chunk_size与表格结构保留配置是否匹配。 - 上传临时公告文档,对比上传前后的解析任务状态,验证增量解析配置是否正常触发。
- 构造包含核心科目与辅助字段的测试文本,检索后查看结果排序,验证分块权重配置是否符合业务需求。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。