模型指南官方文档4 分钟阅读模型组合页

Grok 1000K 上下文 这一档模型配 Milvus 的配置口径

Grok 1000K 上下文模型系列,例如 `grok-4.3` 和 `grok-4.20-multi-agent-0309`,具备 1000000 的上下文长度,这意味着在单次请求中可以输入大量的文本信息,为复杂的 RAG 场景提供了充足的空间。引用上限 1000000 限制了知识库召回内容在模型

这一档模型的参数意味着什么

Grok 1000K 上下文模型系列,例如 grok-4.3 和 grok-4.20-multi-agent-0309,具备 1000000 的上下文长度,这意味着在单次请求中可以输入大量的文本信息,为复杂的 RAG 场景提供了充足的空间。引用上限 1000000 限制了知识库召回内容在模型输入中的最大令牌数,这与上下文长度共同决定了召回策略。图片输入能力允许模型处理图像信息,拓展了多模态应用的边界。工具调用功能则支持模型通过外部工具执行特定操作,增强了其自动化和集成能力。

配 Milvus 要定哪些

配置项建议取法这样取的依据
MILVUS_ADDRESSyour_milvus_host:19530指定 Milvus 服务的网络地址和端口,确保连接可用。
MILVUS_TOKENyour_milvus_api_key用于 Milvus Cloud 或启用认证的 Milvus 实例的身份验证。
index_typeHNSWHNSW 索引在召回性能和构建速度之间提供了较好的平衡。
metric_typeIPIP(内积)距离度量适用于许多常见的语义相似度计算场景。
nprobe32搜索时探查的簇数量,影响召回精度和查询延迟,可根据实测调整。
ef128HNSW 索引构建和搜索时的邻居数量,影响索引质量和搜索精度。

这两者互相约束的地方

模型上下文长度是 RAG 系统的核心约束。召回条数与每段长度的乘积必须小于模型的上下文预算,以避免截断或溢出。例如,如果每段召回内容平均 500 字符(约 150 token),在 1000000 上下文长度限制下,理论上可以放入约 6600 段。然而,模型的引用上限 1000000 令牌,这决定了实际能用于引用的知识库内容上限。在实际应用中,FastGPT 的召回条数设置、向量库返回条数限制以及模型引用上限三者之间取最小生效值。Milvus 的索引参数,如 ef 和 nprobe,调大通常会提升召回精度,但也可能增加查询延迟和计算资源消耗。在模型上下文充裕的情况下,高精度的召回有助于模型获得更准确的输入,从而提升生成质量。

容易做错的三处

  • 调用 Milvus 时出现 gRPC connection error: 14 UNAVAILABLE:通常是 MILVUS_ADDRESS 配置错误或 Milvus 服务未启动。
  • 模型返回的答案缺乏相关知识库内容支持,但 Milvus 返回了大量结果:可能是 FastGPT 的召回策略设置不合理,导致向量库返回的条数被进一步过滤,或引用的令牌数超过了模型的引用上限。
  • 向量搜索响应时间过长,导致整个请求超时:可能是 Milvus 实例负载过高、网络延迟大,或 nprobe、ef 等索引参数设置过大导致搜索计算量剧增。

怎么确认配好了

  • 检查 FastGPT 后台的 Milvus 连接状态,确保显示为“已连接”。
  • 在 FastGPT 的知识库管理界面,上传少量文档,并尝试进行召回测试,观察召回结果是否符合预期。
  • 监控 Milvus 服务的日志,确认是否有查询请求正常到达,并观察查询延迟是否在可接受范围内。
  • 通过 FastGPT 的调试模式,查看模型接收到的实际上下文内容,确认召回条数和每段长度是否合理,且总令牌数未超过模型引用上限。

参考资料