这个品类的数据长什么样
电网设备企业财报数据来源于上海证券交易所、深圳证券交易所公开披露的定期报告、临时公告,以及企业官方公开的年度经营简报。更新节奏以年度、季度定期报告为主,重大订单、产能变动等事项将通过临时公告实时更新。文档多为PDF格式,包含合并资产负债表、利润表、现金流量表,以及经营数据附注、分业务板块营收明细、设备产能与订单数据等。字段涵盖营收、净利润、研发费用、合同负债、装机容量、设备产能等,单位多为人民币万元、万千瓦、台套。
这些特征在「向量模型与索引」这一环带来什么约束
电网设备企业财报多为长文本结构,单份年度财报文本量可达数万字符,且包含大量嵌套表格与结构化附注数据,要求向量模型需支持长文本分段与表格内容的结构化向量化。财报按季度、年度高频更新,且不同企业披露格式存在差异,需支持增量索引与多格式文档的统一预处理。财报中包含电网设备专属业务字段,如分板块营收、装机产能等,需确保向量模型能准确捕捉财务与电力设备行业的专业术语语义,避免语义偏移。部分临时公告文本较短但时效性强,需适配短文本的快速索引与召回。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
EMBEDDING_MODEL | bge-large-zh-v1.5 或 text-embedding-3-large | 支持1024以上的上下文窗口,能覆盖电网设备财报的长文本段落,且对金融与电力设备专业术语语义理解较好 |
CHUNK_SIZE | 800–1200 字符 | 电网设备财报的附注段落多为数百到数千字符,该区间可平衡上下文完整性与召回精度,避免单段过长导致的语义稀释 |
CHUNK_OVERLAP | 100–150 字符 | 避免长文本分段后出现关键财务数据与业务说明的割裂,保障连续信息被完整覆盖 |
RECALL_TOP_K | 前 8–12 条 | 电网设备财报的核心数据分布相对集中,适量召回可覆盖多板块营收、产能等关键信息,避免召回过多引入噪声 |
PARSE_TABLE_MODE | 结构化提取 | 电网设备财报包含大量财务与业务产能表格,结构化提取可保留表格字段与数值的对应关系,提升向量化精度 |
INDEX_STORAGE_TYPE | MongoDB 向量索引 | FastGPT原生支持该存储类型,可适配高频更新的财报数据,支持增量索引与多维度查询 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:调用向量模型时返回
400 Bad Request错误,提示上下文长度超出限制。原因:未根据电网设备财报的长文本特征调整CHUNK_SIZE参数,单段文本超过所选嵌入模型的最大上下文窗口。 - 现象:知识库导出的
dataset.csv仅包含index字段,无content字段。原因:未开启文档解析后的文本提取开关,或在配置INDEX_STORAGE_TYPE时未正确关联MongoDB的content字段,导致原始文本未被存储。 - 现象:索引召回结果中未包含分业务板块营收数据,召回精度偏低。原因:未开启表格结构化解析模式,财报中的业务表格被转为无序文本,导致向量模型无法捕捉板块营收的语义关联。
怎么确认配好了
- 上传单份电网设备企业年度财报PDF,查看解析后的文本分段结果,确认分段长度符合预设的
CHUNK_SIZE区间,且重叠部分保留关键财务数据。 - 进入FastGPT的向量模型管理页面,验证所选嵌入模型已正确配置,且支持的上下文窗口大于预设的
CHUNK_SIZE。 - 执行一次知识库召回测试,输入包含电网设备业务关键词的查询语句,查看召回结果中是否包含对应业务板块的财务数据,确认召回条数符合预设的
RECALL_TOP_K范围。 - 导出知识库的
dataset.csv文件,确认文件中同时包含index与content字段,且content字段包含财报的完整文本内容。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。