模型指南官方文档4 分钟阅读模型组合页

Groq 131K 上下文 这一档模型配 Milvus 的配置口径

本档模型,如 `qwen/qwen3.6-27b` 和 `meta-llama/llama-4-scout-17b-16e-instruct`,具备 131072 的上下文长度,表明其能够处理大量输入信息。引用上限 120000 意味着在 RAG 场景下,可用于模型引用的知识库内容总量存在上限。模型

这一档模型的参数意味着什么

本档模型,如 qwen/qwen3.6-27b 和 meta-llama/llama-4-scout-17b-16e-instruct,具备 131072 的上下文长度,表明其能够处理大量输入信息。引用上限 120000 意味着在 RAG 场景下,可用于模型引用的知识库内容总量存在上限。模型支持图片输入,可处理多模态查询;支持工具调用,能与外部系统进行交互以执行特定任务或获取实时信息。这些特性共同构成了其在复杂应用场景下的工程能力边界。

配 Milvus 要定哪些

配置项建议取法这样取的依据
MILVUS_ADDRESSmilvus-service:19530内部部署时服务发现地址,确保连接性。
MILVUS_TOKEN按实际认证凭证设置访问 Milvus 服务的鉴权,保障数据安全。
HNSW efConstruction128HNSW 索引构建时的邻居数,影响索引质量与构建速度的平衡。
HNSW M16HNSW 索引中每个节点的最大出边数,影响搜索精度与内存占用。
检索条数10初始召回的向量条数,平衡召回率与后续模型处理上下文的压力。
单段字符数500-800 字符知识库切分粒度,保证每段信息完整性且不超模型上下文单次处理能力。

这两者互相约束的地方

模型上下文长度和引用上限直接决定了 Milvus 召回结果的有效利用率。在实际操作中,Milvus 返回的召回条数与每段知识内容的字符长度乘积,不应超过模型的 131072 上下文长度。如果引用上限为 120000,则 Milvus 召回的知识内容总和(字符数)不应超过此值,否则超出部分将无法被模型有效利用。此外,Milvus 的索引参数,如 HNSW 的 efConstruction 和 M 值,直接影响向量检索的效率和准确性。当这些参数调大时,Milvus 检索精度可能提高,但计算资源消耗也会增加。高精度的召回结果能为模型提供更准确的上下文,减少模型“幻觉”的发生,但如果召回条数过多,可能反而会挤占模型上下文,导致模型无法有效处理所有信息。因此,需在召回条数、每段长度、索引参数与模型上下文能力之间进行权衡。

容易做错的三处

  • 日志显示 Connection refused 或 Authentication failed:Milvus 服务地址 MILVUS_ADDRESS 或 MILVUS_TOKEN 配置错误,导致无法连接或认证失败。
  • 模型输出内容与知识库内容相关性低,或者出现大量重复信息:召回条数设置过少,或 Milvus 索引参数 HNSW M 和 efConstruction 设置不合理,导致检索质量不佳。
  • 模型返回 Context window exceeded 错误:Milvus 召回的知识内容总长度(召回条数 × 单段字符数)超过了模型 131072 的上下文长度上限。

怎么确认配好了

  • 通过 FastGPT 平台配置页面,查看 Milvus 连接状态是否显示“已连接”,并尝试进行一次知识库导入,确认向量化与写入流程顺畅。
  • 针对特定查询,观察模型生成回答时引用的知识点是否准确且完整,结合 FastGPT 的调试功能,查看 Milvus 实际召回的向量条数与内容。
  • 在实际运行一段时间后,监控 FastGPT 服务的日志,检查是否有关于模型上下文溢出或 Milvus 连接错误的告警,根据告警频率和具体错误信息调整 单段字符数 或 检索条数 等参数。

参考资料