这个品类的数据长什么样
光模块财报的数据来源包括上市公司公开披露的定期报告、光模块行业研究机构发布的专项报告、厂商自主披露的经营简报。更新节奏为上市公司按季度、年度固定更新,行业报告与厂商简报按需发布。单份文档通常包含报告期说明、核心经营数据、业务板块拆解、下游应用分类、研发投入等内容。字段与单位包括:报告期采用YYYY-MM格式,出货量单位为万件,营收单位为人民币元,单价单位为元/件,研发投入单位为人民币元。
这些特征在「向量模型与索引」这一环带来什么约束
光模块财报的固定低频更新、结构化字段多、来源多样的特征,对向量模型与索引环节带来多项约束。固定低频更新要求下,索引支持增量更新,无需全量重建,降低运维成本。结构化字段多的特点要求向量模型适配结构化元数据编码,同时索引需支持多字段联合召回。下游应用分类的多维度标签需求,要求索引支持标签过滤功能,避免召回非光模块品类的无关数据。单份文档长度较长的特征,要求调整分段策略以保留字段间的语义关联。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
EMBEDDING_MODEL_PATH | http://localhost:8000/v1(本地VLLM部署地址) | 光模块财报的结构化字段需要适配通用嵌入模型的长文本编码能力,VLLM可高效部署Qwen3-Embedding-8B模型 |
CHUNK_SIZE | 1000–1500 字符 | 光模块财报字段密集,分段过长会丢失字段关联,过短会破坏语义完整性 |
RECALL_TOP_K | 前8–12条 | 财报分析需要覆盖多维度经营数据,过多召回会引入无关信息,过少会遗漏关键字段 |
VECTOR_STORE_TYPE | Milvus | 光模块财报存在多字段联合查询需求,Milvus支持结构化过滤与向量召回的混合查询 |
PARSE_STRUCTURED_DATA | 开启 | 光模块财报包含标准化经营字段,开启后可提取字段级元数据用于向量索引优化 |
MAX_DOCUMENT_LENGTH | 50000 字符 | 上市公司年报通常包含数万字符的经营数据,适配该长度可完整处理单份财报文档 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 启动Milvus容器时出现
dial tcp 127.0.0.1:5432: connect: connection refused报错,无法完成部署。原因是未修改默认compose文件中的PostgreSQL依赖配置,光模块财报的结构化查询无需额外PG存储,冗余配置导致启动失败。 - 在FastGPT中配置VLLM部署的Qwen3-Embedding-8B模型时,出现
400 Bad Request报错。原因是未正确对齐EMBEDDING_MODEL_PATH的端口与模型路径,光模块财报的嵌入编码需要匹配模型的输入格式,未对齐的配置导致请求失败。 - 知识库检索结果中出现非光模块品类的财报文档,召回结果与预期不符。原因是未开启
PARSE_STRUCTURED_DATA开关,未提取财报的行业、报告期字段作为过滤条件,导致向量召回未关联光模块专属数据。
怎么确认配好了
- 进入FastGPT的向量库管理页面,查看已连接的向量库状态,确认
VECTOR_STORE_TYPE与配置项一致,无连接报错提示。 - 上传一份标准光模块财报测试文档,查看切分后的文档块数量,确认与
CHUNK_SIZE的设置匹配,无过度切分或未完整处理的情况。 - 发起一次定向财报检索请求,查看召回结果中是否包含对应报告期的光模块经营数据,确认结构化过滤规则生效。
- 查看向量库的磁盘占用统计,确认存储内容仅包含原文档、切分后的文档块与嵌入向量,无冗余数据。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。