模型指南官方文档4 分钟阅读模型组合页

MiniMax 204K 上下文 这一档模型配 openGauss 的配置口径

MiniMax 模型的这一档配置,其上下文长度 `maxContext` 达到 204000 token,为处理大规模文本提供了充足空间。单次最大输出虽然未明确标注,但通常足以满足多数生成需求。引用上限 `quoteMaxToken` 设定在 200000 token,这意味着在单次模型调用中,用于

这一档模型的参数意味着什么

MiniMax 模型的这一档配置,其上下文长度 maxContext 达到 204000 token,为处理大规模文本提供了充足空间。单次最大输出虽然未明确标注,但通常足以满足多数生成需求。引用上限 quoteMaxToken 设定在 200000 token,这意味着在单次模型调用中,用于引用外部检索内容的 token 总量不能超过此限制。引用上限是模型处理引用内容的预算,而向量库返回的段落条数是检索侧的输出量,两者在工程实践中需要协同考量。此外,这一档模型支持工具调用,可以集成外部服务和功能,但不具备图片输入能力。

配 openGauss 要定哪些

配置项建议取法这样取的依据
OPENGAUSS_URLpostgresql://user:password@host:port/database数据库连接字符串,确保可访问 openGauss 实例
ef_construction64HNSW 索引构建参数,影响索引质量和构建速度
ef_search32HNSW 搜索参数,影响召回精度和查询延迟
m16HNSW 索引的邻居数量,影响内存占用和查询性能
每段召回字符数500-800 字符兼顾信息完整性与模型上下文窗口利用效率
召回条数10-20 条平衡召回广度与模型处理负荷

这两者互相约束的地方

这一档 MiniMax 模型的上下文长度为 204000 token,而引用上限为 200000 token。这意味着在将 openGauss 检索结果输入模型时,所有召回内容的 token 总和必须在引用上限之内。向量库的召回是按照段落条数计算的,而模型的引用上限是按 token 计量的。当每段文本较短时,模型可能因为达到最大召回条数而停止引用;当每段文本较长时,模型可能因为达到引用 token 上限而停止引用。因此,召回条数与每段长度的乘积必须小于模型的上下文预算。openGauss 的 ef_construction 和 ef_search 参数调大,可以提升召回精度,为模型提供更相关的上下文,从而更好地利用模型的引用上限。

容易做错的三处

  • 日志显示 context window exceeded:原因可能是召回条数过多或每段文本过长,导致引用内容总 token 超过了模型的引用上限。
  • 检索结果返回为空或条数不足:原因可能是 openGauss 的 ef_search 参数设置过低,导致搜索精度不足,未能召回足够的相关文档。
  • 模型回答质量不佳,缺乏相关性:原因可能是 openGauss 的 HNSW 索引参数 m 或 ef_construction 设置不当,导致向量索引质量不高,影响了召回内容的准确性。

怎么确认配好了

  • 通过 FastGPT 调试界面,观察模型每次引用内容的 token 计数,确保其稳定在 200000 token 引用上限以下。
  • 对 openGauss 数据库执行基准测试,监控 SELECT 查询的平均延迟,确保在可接受范围内。
  • 随机选取若干用户查询,检查 openGauss 返回的召回文档内容,判断其与查询的相关性是否达到预期,并根据实际业务场景调整 ef_search 参数。
  • 在 FastGPT 知识库中上传大量文档后,检查 openGauss 索引构建过程的日志,确保 ef_construction 和 m 参数配置下索引能稳定构建完成。

参考资料