模型指南官方文档4 分钟阅读模型组合页

Groq 196K 上下文 这一档模型配 Milvus 的配置口径

`minimaxai/minimax-m2.7` 模型档位拥有 196608 token 的上下文长度,这意味着单次请求可以处理非常大量的输入信息,为复杂场景下的知识召回和推理提供了充足的空间。引用上限 190000 token 明确了知识库引用内容的总量限制,直接影响到可以同时注入模型的知识片段数

这一档模型的参数意味着什么

minimaxai/minimax-m2.7 模型档位拥有 196608 token 的上下文长度,这意味着单次请求可以处理非常大量的输入信息,为复杂场景下的知识召回和推理提供了充足的空间。引用上限 190000 token 明确了知识库引用内容的总量限制,直接影响到可以同时注入模型的知识片段数量。该模型支持工具调用,允许其与外部系统进行交互,执行特定任务,从而扩展了其能力边界。不支持图片输入,表明图像分析任务需要通过其他模型或预处理流程完成。单次最大输出未标注,实际输出长度需通过测试确定,但通常受限于上下文总长。

配 Milvus 要定哪些

配置项建议取法这样取的依据
MILVUS_ADDRESS127.0.0.1:19530 或 cloud.milvus.io:19530指定 Milvus 服务端点,本地部署或云服务地址。
MILVUS_TOKENBearer your_api_keyMilvus Cloud 或启用认证的 Milvus 实例的访问凭证。
HNSW M32HNSW 索引参数,影响召回精度与查询速度,平衡召回效果与资源消耗。
HNSW efConstruction128HNSW 索引构建参数,影响索引质量和构建时间。
IPL2相似度度量方式,与模型嵌入向量的度量方式保持一致,确保相似性计算的准确性。
召回条数20-30结合模型引用上限和单段平均长度,避免超出模型输入限制,同时保证信息覆盖度。

这两者互相约束的地方

模型 196608 token 的上下文长度与 190000 token 的引用上限,直接决定了从 Milvus 中召回的知识片段总量。具体来说,召回条数与每段平均长度的乘积必须小于 190000 token,以确保所有引用内容都能被模型处理。如果 Milvus 配置的召回条数过多,或者每个知识片段过长,将导致模型输入超限。此时,引用上限(190000 token)会先生效,截断超出部分的引用内容。Milvus 的索引参数,如 HNSW 中的 M 和 efConstruction,调大可以提升召回精度,但会增加索引构建时间和查询延迟。对于此档上下文容量大的模型,高精度的召回有助于充分利用其理解能力,但需要权衡 Milvus 的资源消耗。IP(内积)作为相似度度量,必须与模型生成嵌入向量时使用的度量方式一致,否则将导致相似性计算失准,影响召回质量。

容易做错的三处

  • 连接 Milvus 报错 Failed to connect to Milvus server:通常是 MILVUS_ADDRESS 配置错误或 Milvus 服务未启动。
  • 模型返回内容不完整或截断,日志显示 token limit exceeded:召回条数与每段长度之和超过了模型的 190000 token 引用上限。
  • 召回结果相关性差,但 Milvus 返回条数正常:IP 相似度度量与模型嵌入向量的度量方式不匹配,或 Milvus 索引参数 HNSW 配置过低导致召回精度不足。

怎么确认配好了

  • 检查 Milvus 连接状态:通过 Milvus 客户端调用 has_collection 或 list_collections 等方法,确认能正常连接并操作 Milvus 实例。
  • 测试召回效果与模型输入:在 FastGPT 中配置少量知识库内容,进行单轮对话测试,观察模型返回的引用内容是否完整且相关,同时检查 FastGPT 内部日志或 Milvus Query 日志,确认 Milvus 返回的向量条数与预期一致。
  • 调整召回条数与每段长度:逐步增加知识库召回条数,观察模型输出是否出现截断或报错,以此确定在保证相关性的前提下,引用上限 190000 token 对应的最大召回量。

参考资料