模型指南官方文档4 分钟阅读模型组合页

MiniMax 204K 上下文 这一档模型配 Milvus 的配置口径

这一档模型具备 204000 token 的上下文长度,决定了在单次交互中能处理的最大输入信息量,包括用户提问、历史对话以及召回内容。单次最大输出虽未明确标注,但通常支持较长的回答。引用上限为 200000 token,这是 FastGPT 用于承载检索内容的预算。引用内容的 token 预算限制的

这一档模型的参数意味着什么

这一档模型具备 204000 token 的上下文长度,决定了在单次交互中能处理的最大输入信息量,包括用户提问、历史对话以及召回内容。单次最大输出虽未明确标注,但通常支持较长的回答。引用上限为 200000 token,这是 FastGPT 用于承载检索内容的预算。引用内容的 token 预算限制的是引用内容合计占用的 token 数量。段落条数由检索侧的返回条数决定,两者是不同的量。模型支持工具调用,可以集成外部功能,但不支持图片输入,无法处理视觉信息。

配 Milvus 要定哪些

配置项建议取法这样取的依据
MILVUS_ADDRESSyour_milvus_host:19530连接 Milvus 服务的标准地址与端口,确保网络可达
MILVUS_TOKEN按实测标定Milvus 身份验证令牌,保证连接安全与权限
index_typeHNSW适用于高维向量高效近似最近邻搜索,平衡查询速度与精度
metric_typeIP内积距离计算,适用于需要衡量向量相似度且值域有意义的场景
recall_k32Milvus 检索返回的向量数量,影响后续召回段落的丰富度
segment_max_tokens800-1200 字符单个文本段落的最大字符长度,结合模型引用上限估算

这两者互相约束的地方

召回条数与每段长度的乘积不能超过这一档模型的上下文预算。引用上限按 token 计,向量库返回的按条数计,因此谁先触顶取决于每段文本的实际 token 长度。例如,如果每段文本较短,则可以召回更多条数;如果每段文本较长,则召回条数会相应减少以避免超出引用上限。Milvus 的索引参数,如 HNSW 的 M 和 efConstruction,调大后可以提升检索精度和召回率,这对于利用 MiniMax 204K 上下文模型的长上下文能力至关重要。更精准的召回能够为模型提供更相关的上下文,进而生成更高质量的回复。

容易做错的三处

  • 日志显示 Connection refused 或 Authentication failed:Milvus 地址 MILVUS_ADDRESS 或 MILVUS_TOKEN 配置错误。
  • 界面提示“引用内容过长”:召回条数过多或单段文本 segment_max_tokens 过长,导致超出模型的 quoteMaxToken。
  • 返回结果中引用内容为空或不相关:Milvus 检索参数 recall_k 设置过低,或索引 metric_type 不适用于当前数据。

怎么确认配好了

  • 在 FastGPT 知识库管理页面,尝试导入文档并观察是否成功切片并送入 Milvus,检查 Milvus 监控指标确认向量写入量。
  • 通过 FastGPT 的调试功能,输入测试问题并查看模型返回的引用内容,评估其相关性与数量是否符合预期。
  • 调整 recall_k 参数,观察 FastGPT 调试界面中引用的段落数量变化,确保在 quoteMaxToken 预算内能有效召回。

参考资料