这个品类的数据长什么样
消费建材财报数据主要来自上市公司年度报告、证券交易所公开披露文件、行业协会月度运行报告。更新节奏为年度报告于年度结束后4个月内发布,季度报告于季度结束后1个月内发布,行业报告按月度更新。文档以PDF格式为主,包含结构化财务报表、产能拆解、营收拆分表格,字段包含当期营收、单位面积成本、单吨生产成本,单位涉及万元、平方米、吨等。
这些特征在「引用来源与溯源」这一环带来什么约束
消费建材财报数据来源分散,覆盖上市公司公告、交易所披露文件、行业协会报告,溯源环节需建立多源数据的关联校验逻辑。更新节奏存在差异,年度、季度、月度数据需匹配不同的更新触发逻辑。文档包含结构化表格与长文本,分割时需保留字段与单位的绑定关系,避免溯源时丢失对应信息。字段单位存在差异,不同子品类的计量标准不同,需确保溯源时保留原始单位标注。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
召回条数 | 前8–12条 | 消费建材财报单份文档分割后块数较多,过多召回会引入冗余内容,过少会遗漏细分品类的关键数据 |
相似度阈值 | 0.72–0.85 | 消费建材财报的结构化字段匹配精度要求较高,阈值过低会引入无关文档块,过高会遗漏相关细分数据 |
PARSE_TABLE_STRICT_MODE | 开启 | 消费建材财报含大量分品类营收拆分表格,开启严格模式可保留字段与单位的关联关系 |
知识库更新周期 | 按季度+月度 | 匹配财报年度、季度报告与行业月度报告的披露节奏 |
UPLOAD_FILE_MAX_SIZE | 200 MB | 单份消费建材年报PDF通常在50–150 MB,设置合理上限避免解析超时 |
重排返回条数 | 前4–6条 | 对召回的财报文档块进行重排,保留最相关的溯源片段,避免冗余 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:知识库变量引用时无法显示原文档的页码或段落位置。原因:未开启
PARSE_TABLE_STRICT_MODE,导致结构化表格的字段未被正确分割,无法定位具体溯源位置。 - 现象:本地部署的FastGPT磁盘占用超出预期,日志出现
disk full报错。原因:未设置UPLOAD_FILE_MAX_SIZE,导致大体积的年报PDF被重复上传,嵌入向量占用过多磁盘空间。 - 现象:召回的财报文档块未包含细分品类的营收数据。原因:
相似度阈值设置过高,未匹配到对应细分品类的财报块。
怎么确认配好了
- 上传一份消费建材上市公司年报,进入知识库管理页面,查看解析后的文档块是否保留了字段与单位的关联信息。
- 发起财报分析对话,查看返回结果的溯源栏是否显示原文档的文件名、页码或段落位置。
- 进入系统磁盘监控页面,确认磁盘占用仅包含原文件、分割后的文件块和嵌入向量三类数据。
- 调整
相似度阈值至0.75左右,验证召回结果条数符合前8–12条的区间。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。