这个品类的数据长什么样
证券财报数据来源为沪深北交易所官方披露平台、上市公司指定信息披露渠道。更新节奏分为定期披露与临时披露,定期披露包含季度、半年度、年度报告,固定在披露窗口期发布;临时披露包括业绩预告、更正公告等,无固定发布周期。文档结构以结构化财务表格与大段说明文本结合,涵盖合并财务报表、管理层讨论与分析、财务附注等章节,字段包含归母净利润、扣非净利润、经营活动现金流净额等,单位多为人民币元、万元或亿元。
这些特征在「向量模型与索引」这一环带来什么约束
定期与临时混合的更新节奏,要求索引系统支持增量更新与全量重索引两种模式,适配不同披露场景的同步需求。单份财报文档长度差异显著,年报可达数万字符,需要针对长文本设计合理的分段规则,避免语义切割偏差。结构化表格与自由文本混合的文档结构,要求向量模型同时适配结构化语义与非结构化文本的编码逻辑。字段与单位的标准化特征,需要在索引时保留元数据标签,为后续精准召回提供依据。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
embedding_model_normalization | 按目标模型要求开启,未归一化模型需设为开启 | 适配不同embedding模型的向量输出格式,避免相似度计算偏差 |
chunk_size | 800–1200 字符 | 适配单份财报的文本长度,避免语义切割过碎或过长 |
recall_top_k | 前8–12 条 | 覆盖财报多章节的关键信息,避免召回不足或冗余 |
max_context_token | 16000–32000 token | 匹配证券财报的总文本长度,确保召回内容完整传入大模型 |
vector_index_refresh_interval | 1小时(定期报告窗口期)/ 24小时(常规时段) | 适配财报的更新节奏,平衡同步及时性与系统负载 |
force_rebuild_index | 按界面提示触发 | 解决向量模型切换后的索引重建问题,强制重建兼容新模型的索引 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:切换知识库向量模型后,索引进度无更新且无法回退至原模型。原因:未触发
force_rebuild_index配置,系统未重建索引以适配新模型参数,导致索引与当前模型不兼容。 - 现象:知识库查询时传入的上下文token超出预设阈值,导致查询延迟升高。原因:未根据单份财报的平均长度调整
max_context_token配置,直接设置为超出系统负载的取值。 - 现象:财报中附带的图表、截图无法被正确索引更新。原因:未升级至4.8.23及以上版本,旧版本不支持图片向量索引的增量更新功能。
怎么确认配好了
- 进入向量模型配置页面,确认
embedding_model_normalization的取值与当前使用的embedding模型匹配。 - 上传单份季度财报,查看解析后的文本分段长度符合预设的
chunk_size范围。 - 提交一次增量索引任务,确认任务进度条正常更新且无失败提示。
- 发起模拟查询,核对召回结果中包含财报的核心字段与对应单位信息。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。