这个品类的数据长什么样
玻璃财报数据主要来自建筑玻璃行业协会公开月度运行数据、上市玻璃制造企业年度及季度定期报告、海关建材品类进出口统计数据。数据更新节奏为月度行业数据每月5日前发布,上市公司财报按季度、年度固定节点更新。文档多为结构化表格与行业分析文字结合,包含浮法玻璃、钢化玻璃等细分品类的产能、产量、平均售价、库存周转天数等字段,单位涉及万重箱、元/平方米、吨、万平方米等。
这些特征在「向量模型与索引」这一环带来什么约束
玻璃财报的结构化多字段、分节点增量更新、细分品类多样的特征,对向量模型与索引环节带来多重约束。结构化数值字段需单独提取语义特征,与文本分析内容做融合嵌入;月度增量数据需支持增量索引更新,避免全量重建耗时过长;单文档长度因细分品类分析篇幅差异较大,需动态调整分段阈值;建材行业专属术语需匹配适配的嵌入模型,确保语义向量的准确性。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
embedding_api_base | http://localhost:11434/v1 | 适配本地部署的ollama托管的Qwen3-Embedding-8B:F16模型的API接口格式 |
chunk_size | 800–1200 字符 | 匹配玻璃财报中结构化表格段落与行业分析文本的平均长度,避免分段割裂语义关联 |
milvus_shard_num | 2–4 | 适配月度增量向量数据的存储规模,平衡单集群节点的查询并发与存储成本 |
rerank_top_k | 前 5–8 条 | 适配玻璃财报多细分品类的召回需求,过滤冗余低相关结果 |
similarity_score_threshold | 0.72–0.80 | 匹配建材行业专属术语的语义相似度分布,过滤非相关召回内容 |
max_rag_context | 8000 字符 | 适配单篇完整财报分析的向量拼接总长度,避免超出模型上下文限制 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:启动Milvus容器时出现数据库连接失败,日志包含
psql: error: could not connect to server。原因:使用了包含PostgreSQL作为元数据存储的默认Milvus Compose文件,未切换至使用Etcd作为元数据存储的配置版本,导致依赖缺失无法启动。 - 现象:测试嵌入模型连接时返回
connection refused或404 Not Found报错。原因:未正确配置嵌入模型的API基础地址与端口,或本地ollama服务未加载指定的Qwen3-Embedding-8B:F16模型,导致无法接收请求。 - 现象:解析后的财报文档出现字段碎片化,召回结果中缺失完整的单品类营收数据。原因:设置的
chunk_size过小,将结构化表格的整行或整列拆分为独立分段,丢失字段间的语义关联,未启用FastGPT的结构化文档表格合并解析开关。
怎么确认配好了
- 执行嵌入模型连接测试,查看界面返回的模型标识与配置的模型名称一致,无连接超时或权限报错。
- 上传单篇玻璃行业财报文档,查看解析后的分段列表,确认分段长度符合配置的
chunk_size范围,结构化表格未被过度拆分。 - 输入行业相关关键词,如“2024年浮法玻璃产能”,核对召回结果的数量符合配置的
rerank_top_k设置,且相关性符合预设阈值规则。 - 导入单篇新增的月度财报数据,观察索引系统仅更新新增的向量数据,未触发全量索引重建流程。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。