这一档模型的参数意味着什么
Qwen 260K 上下文模型档位提供 260000 token 的上下文长度,决定了单次交互中模型可处理的总文本量。引用上限 260000 token,这是模型用于接收引用内容的预算,它限定了引用内容的总 token 量。段落条数由检索系统返回的数量决定,引用上限与段落条数是两个不同的衡量维度。模型支持工具调用能力,可以与外部工具集成以扩展功能。该模型不支持图片输入。这些参数共同定义了模型在处理长文本、引用信息和进行工具交互时的能力边界。
配 Milvus 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
HNSW efConstruction | 100–200 | 构建索引时的邻居搜索范围,影响索引构建速度与查询精度。 |
HNSW ef | 200–400 | 查询时的邻居搜索范围,影响查询速度与召回率。 |
IP (内积) | L2 或 COSINE | 相似度计算方式,需与向量嵌入模型输出的度量空间匹配。 |
MILVUS_ADDRESS | milvus-cluster:19530 | Milvus 服务的网络地址和端口,确保 FastGPT 可以正确连接。 |
MILVUS_TOKEN | 按部署密钥配置 | Milvus 访问认证凭证,用于安全连接。 |
| 召回条数 | 20–30 | 经验值,通常能覆盖长上下文模型所需信息,结合每段长度避免超出引用上限。 |
这两者互相约束的地方
模型上下文长度是总预算,其中一部分会分配给用户输入、历史对话,另一部分用于引用内容。引用上限按 token 计数,而向量库返回的是固定数量的段落。当每段文本较短时,可以在引用上限内包含更多段落;当每段文本较长时,即使段落数量不多,也可能快速触及引用上限。因此,召回条数乘以每段平均长度的结果,必须在引用上限的预算之内。Milvus 的索引参数如 efConstruction 和 ef 调大,通常会提升检索的召回率与精度,这意味着向量库能够更准确地找到相关段落。这些更相关的段落被引入 Qwen 260K 上下文模型后,有助于模型生成更精准、更深入的回答,但同时也需要确保这些高质量的引用内容不会超出模型的引用 token 限制。
容易做错的三处
- 连接 Milvus 失败,返回
Error: gRPC connection failed:MILVUS_ADDRESS配置错误或 Milvus 服务未启动。 - 查询结果为空,但知识库中明明有数据:
IP相似度度量方式与向量嵌入模型不匹配,导致检索不到结果。 - 模型返回的引用内容不完整或过短:召回条数过多导致单次引用内容超出模型的引用上限。
怎么确认配好了
- 通过 FastGPT 知识库管理界面,查看 Milvus 连接状态是否正常。
- 导入少量测试数据后,执行简单检索,观察返回的段落数量和内容是否符合预期。
- 针对一个包含复杂问题的知识库,进行一次完整对话,确认模型引用内容是否充足且回答准确。
- 监控 Milvus 服务的查询延迟和资源占用,确保在当前负载下性能满足要求。