模型指南官方文档4 分钟阅读模型组合页

Moonshot 32K 上下文 这一档模型配 Milvus 的配置口径

Moonshot 32K 上下文模型,其 `上下文长度 32000` 决定了单次请求中可携带的指令、历史对话和召回知识的总量上限。`单次最大输出 未标注` 意味着实际输出长度可能受限于模型内部逻辑或平台设定,但在工程实践中,通常需要预留足够的空间。`引用上限 32000` 明确了知识库引用段落数量的

这一档模型的参数意味着什么

Moonshot 32K 上下文模型,其 上下文长度 32000 决定了单次请求中可携带的指令、历史对话和召回知识的总量上限。单次最大输出 未标注 意味着实际输出长度可能受限于模型内部逻辑或平台设定,但在工程实践中,通常需要预留足够的空间。引用上限 32000 明确了知识库引用段落数量的理论天花板,高于此上限的召回内容将无法被模型直接引用。图片输入 false 表明该模型不具备处理图像信息的能力,相关输入链路需避免。工具调用 true 则确认了该模型支持通过工具接口扩展其能力,允许执行外部函数或访问外部数据。

配 Milvus 要定哪些

配置项建议取法这样取的依据
MILVUS_ADDRESSlocalhost:19530 或 your_milvus_cluster_ip:19530Milvus 服务端点,确保客户端能正确连接。
MILVUS_TOKEN按实测标定Milvus 身份验证令牌,取决于 Milvus 部署的安全配置。
index_type (索引类型)HNSWHNSW 索引在召回性能与精度之间提供良好平衡,适合大规模向量检索。
metric_type (度量类型)IP (内积)IP 适用于衡量向量间的相似度,与许多嵌入模型输出的向量兼容。
nlist (HNSW参数)128影响 HNSW 索引构建和查询性能,128 是一个常见的平衡值。
ef (HNSW参数)64查询时的搜索范围,影响召回精度,64 可提供较好的召回效果。

这两者互相约束的地方

模型 上下文长度 32000 对召回策略有直接约束,即 召回条数 × 每段平均字符数 的总和必须远小于该长度,以预留足够的空间给指令和历史对话。同时,模型的 引用上限 32000 与 Milvus 返回的 top_k 数量构成一个双重限制。实际生效的是二者中的较小值:即使 Milvus 返回了大量结果,模型也只能处理其引用上限内的条目。当 Milvus 的 HNSW 索引参数,如 nlist 或 ef 调大时,通常意味着更高的召回精度,但可能伴随查询延迟的增加。对于 上下文长度 32000 的模型,如果召回内容质量更高,即便条目数量略少,也可能带来更好的模型表现。

容易做错的三处

  • 连接 Milvus 时出现 Connection refused 错误:通常是 MILVUS_ADDRESS 配置错误或 Milvus 服务未启动。
  • 查询结果 top_k 返回的向量数量少于预期:可能是 Milvus 中集合数据量不足或查询条件过滤掉了大量数据。
  • 模型返回的回答中知识引用不准确或缺失:可能原因在于召回的知识段落质量不高,或者 每段平均字符数 过长导致上下文空间不足,模型无法有效处理所有信息。

怎么确认配好了

  • 在 FastGPT 平台配置连接后,尝试对知识库进行一次向量化上传,检查 Milvus 客户端是否能查询到对应向量数据。
  • 执行一次 RAG 问答流程,观察模型返回的引用信息是否包含 Milvus 中召回的段落 ID 或内容片段。
  • 调整 Milvus 查询的 top_k 参数,并观察模型回答的引用数量是否随之变化,以确认引用上限与召回条数的协同生效。

参考资料