模型指南官方文档5 分钟阅读模型组合页

MiniMax 204K 上下文 这一档模型配 PostgreSQL(pgvector) 的配置口径

这一档模型(`MiniMax-M2.7`、`MiniMax-M2.7-highspeed`、`MiniMax-M2.5`、`MiniMax-M2.5-highspeed`、`MiniMax-M2.1`、`MiniMax-M2.1-lightning`)具备 204000 token 的上下文长度,意

这一档模型的参数意味着什么

这一档模型(MiniMax-M2.7、MiniMax-M2.7-highspeed、MiniMax-M2.5、MiniMax-M2.5-highspeed、MiniMax-M2.1、MiniMax-M2.1-lightning)具备 204000 token 的上下文长度,意味着单次请求中可承载的输入信息量较大,为 RAG 场景提供了充足的召回空间。引用上限 200000 token 限制了知识库召回内容在模型输入中的最大占比。模型支持工具调用,可集成外部功能,但不支持图片输入,无法处理多模态信息。单次最大输出未标注,实际输出长度需根据具体模型版本和使用场景进行测试。

配 PostgreSQL(pgvector) 要定哪些

配置项建议取法这样取的依据
PG_URLpostgresql://user:password@host:port/database数据库连接的通用格式,确保 FastGPT 能正确连接到 pgvector 实例。
ef_construction64HNSW 索引构建参数,影响索引质量和构建速度。此值在 16 到 512 之间,过低影响召回质量,过高增加索引构建开销。
ef_search40HNSW 索引查询参数,影响查询召回率和速度。此值应大于或等于 k (查询返回结果数量),过低可能导致召回不全。
m32HNSW 索引的邻居数量,影响索引存储大小和查询效率。此值通常在 16 到 64 之间,过低影响召回质量,过高增加存储和查询开销。
vector_dimensions1536向量维度,需与模型生成的嵌入向量维度一致,确保向量能够正确存储和比较。
max_connections100PostgreSQL 最大连接数,根据 FastGPT 部署规模和并发请求量调整,避免连接池耗尽。

这两者互相约束的地方

MiniMax 204K 上下文长度与 PostgreSQL(pgvector) 的召回结果之间存在直接约束。当从 pgvector 召回多条知识段落时,这些段落的总长度加上用户查询、系统指令等,不能超过 204000 token 的上下文预算。如果召回内容过长,需要进行截断或精简,否则可能导致模型报错或性能下降。此外,模型引用上限 200000 token 意味着即使 pgvector 返回了大量相关内容,最终输入到模型中的知识库引用部分也不会超过此限制。索引参数如 ef_construction 和 ef_search 的调整,会影响 pgvector 的召回条数和召回质量。提高 ef_search 值可以增加召回条数或提高召回准确性,这可能导致模型输入内容增加,进而更频繁地触及 MiniMax 模型的上下文长度限制。因此,需要权衡 pgvector 的召回能力与 MiniMax 模型的输入容量。

容易做错的三处

  • 日志中出现 Context window exceeded 错误,原因是召回的知识段落总长度超出了 MiniMax 模型的上下文限制。
  • 模型回答缺乏相关性,但 FastGPT 界面显示召回了大量知识,原因是 ef_search 值设置过低,导致 pgvector 未能检索到最相关的向量。
  • 知识库查询响应时间过长,原因是 ef_construction 或 m 值设置过高,导致 HNSW 索引构建或查询开销过大。

怎么确认配好了

  • 通过 FastGPT 的调试界面,观察每次 RAG 查询的实际输入 token 数量,确保其在 MiniMax 模型的上下文长度限制内。
  • 执行一系列测试查询,检查 FastGPT 返回结果中引用的知识段落是否与用户意图高度相关,并记录每次查询的召回条数。
  • 监控 PostgreSQL 数据库的 CPU、内存和 IO 使用率,确保在 FastGPT 负载下,数据库性能稳定,没有出现资源瓶颈。
  • 检查 FastGPT 的系统日志,确认没有出现 pgvector 连接或查询相关的错误信息,如 connection refused 或 query timeout。

参考资料