模型指南官方文档4 分钟阅读模型组合页

Qwen 260K 上下文 这一档模型配 Milvus 的配置口径

Qwen 260K 上下文模型档位提供 260000 token 的上下文长度,决定了单次交互中模型可处理的总文本量。引用上限 260000 token,这是模型用于接收引用内容的预算,它限定了引用内容的总 token 量。段落条数由检索系统返回的数量决定,引用上限与段落条数是两个不同的衡量维度。模

这一档模型的参数意味着什么

Qwen 260K 上下文模型档位提供 260000 token 的上下文长度,决定了单次交互中模型可处理的总文本量。引用上限 260000 token,这是模型用于接收引用内容的预算,它限定了引用内容的总 token 量。段落条数由检索系统返回的数量决定,引用上限与段落条数是两个不同的衡量维度。模型支持工具调用能力,可以与外部工具集成以扩展功能。该模型不支持图片输入。这些参数共同定义了模型在处理长文本、引用信息和进行工具交互时的能力边界。

配 Milvus 要定哪些

配置项建议取法这样取的依据
HNSW efConstruction100–200构建索引时的邻居搜索范围,影响索引构建速度与查询精度。
HNSW ef200–400查询时的邻居搜索范围,影响查询速度与召回率。
IP (内积)L2 或 COSINE相似度计算方式,需与向量嵌入模型输出的度量空间匹配。
MILVUS_ADDRESSmilvus-cluster:19530Milvus 服务的网络地址和端口,确保 FastGPT 可以正确连接。
MILVUS_TOKEN按部署密钥配置Milvus 访问认证凭证,用于安全连接。
召回条数20–30经验值,通常能覆盖长上下文模型所需信息,结合每段长度避免超出引用上限。

这两者互相约束的地方

模型上下文长度是总预算,其中一部分会分配给用户输入、历史对话,另一部分用于引用内容。引用上限按 token 计数,而向量库返回的是固定数量的段落。当每段文本较短时,可以在引用上限内包含更多段落;当每段文本较长时,即使段落数量不多,也可能快速触及引用上限。因此,召回条数乘以每段平均长度的结果,必须在引用上限的预算之内。Milvus 的索引参数如 efConstruction 和 ef 调大,通常会提升检索的召回率与精度,这意味着向量库能够更准确地找到相关段落。这些更相关的段落被引入 Qwen 260K 上下文模型后,有助于模型生成更精准、更深入的回答,但同时也需要确保这些高质量的引用内容不会超出模型的引用 token 限制。

容易做错的三处

  • 连接 Milvus 失败,返回 Error: gRPC connection failed:MILVUS_ADDRESS 配置错误或 Milvus 服务未启动。
  • 查询结果为空,但知识库中明明有数据:IP 相似度度量方式与向量嵌入模型不匹配,导致检索不到结果。
  • 模型返回的引用内容不完整或过短:召回条数过多导致单次引用内容超出模型的引用上限。

怎么确认配好了

  • 通过 FastGPT 知识库管理界面,查看 Milvus 连接状态是否正常。
  • 导入少量测试数据后,执行简单检索,观察返回的段落数量和内容是否符合预期。
  • 针对一个包含复杂问题的知识库,进行一次完整对话,确认模型引用内容是否充足且回答准确。
  • 监控 Milvus 服务的查询延迟和资源占用,确保在当前负载下性能满足要求。

参考资料