这个品类的数据长什么样
整车财报数据主要来自交易所公开披露的年度报告、季度报告、临时公告,以及车企官网投资者关系板块的官方披露文件。更新节奏为季度报告每季度结束后1-2个月发布,年度报告在年度结束后4个月内发布,临时公告如销量快报、产能调整公告随时披露。文档结构包含财务报表、管理层讨论与分析、车型销量与产能数据、股权结构等章节,字段涵盖营收、单车毛利、车型细分销量等,单位多为人民币元、辆、台等。
这些特征在「知识库检索与召回」这一环带来什么约束
数据来源分散且格式多样,包含结构化报表、非结构化分析文本,要求检索系统支持多源数据接入与格式兼容。更新频率较高且存在临时突发公告,要求知识库支持灵活的增量更新机制,避免数据滞后。单份文档篇幅较长且按章节划分,要求检索分段策略保留章节语义完整性,避免跨章节拼接导致的语义断裂。字段单位存在细微差异,要求检索过程中统一单位基准,避免因单位不匹配导致的匹配偏差。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PARSE_SEGMENT_STRATEGY | 按文档章节自动分段 | 适配整车财报按章节划分的文档结构,保留语义完整性 |
召回条数 | 前8-12条 | 整车财报单份文档内容量大,需足够上下文支撑跨章节分析 |
相似度阈值 | 0.72-0.80 | 财报术语专业性强,平衡精准度与覆盖度,避免遗漏关键匹配 |
增量更新周期 | 每7天 | 适配季度报、临时公告的披露节奏,保证数据时效性 |
UPLOAD_FILE_MAX_SIZE | 200 MB | 单份年度财报PDF通常可达100-150 MB,预留上传空间 |
重排返回条数 | 前5-6条 | 对召回结果二次筛选,聚焦高相关性内容,降低上下文冗余 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:创建知识库时,文本理解模型下拉列表为空,无法选择对应模型。原因:未在平台后台配置对应大模型的有效API密钥,或密钥未获得项目访问权限。
- 现象:检索结果仅返回1个匹配文本块,无法支撑完整的整车财报分析。原因:未调整
召回条数参数,使用了默认的单条召回配置,未适配整车财报长文本的分析需求。 - 现象:上传单份年度财报PDF时触发上传失败报错。原因:未将
UPLOAD_FILE_MAX_SIZE调整至200 MB以上,默认配置限制了大文件上传。
怎么确认配好了
- 进入目标知识库的配置界面,核对
PARSE_SEGMENT_STRATEGY的取值,确认与财报章节分段的设置一致。 - 提交一条包含整车财报核心术语的测试查询,查看检索结果的返回条数是否与配置的
召回条数相符。 - 查看知识库的增量更新日志,确认近7天内披露的车企财报公告已完成自动同步,验证更新周期设置有效。
- 打开单份已解析的财报文档,检查分段后的文本块是否保留了章节语义完整性,未出现跨章节截断的情况。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。