这一档模型的参数意味着什么
这一档模型(MiniMax-M2.7、MiniMax-M2.7-highspeed、MiniMax-M2.5、MiniMax-M2.5-highspeed、MiniMax-M2.1、MiniMax-M2.1-lightning)具备 204000 token 的上下文长度,意味着单次请求中可承载的输入信息量较大,为 RAG 场景提供了充足的召回空间。引用上限 200000 token 限制了知识库召回内容在模型输入中的最大占比。模型支持工具调用,可集成外部功能,但不支持图片输入,无法处理多模态信息。单次最大输出未标注,实际输出长度需根据具体模型版本和使用场景进行测试。
配 PostgreSQL(pgvector) 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PG_URL | postgresql://user:password@host:port/database | 数据库连接的通用格式,确保 FastGPT 能正确连接到 pgvector 实例。 |
ef_construction | 64 | HNSW 索引构建参数,影响索引质量和构建速度。此值在 16 到 512 之间,过低影响召回质量,过高增加索引构建开销。 |
ef_search | 40 | HNSW 索引查询参数,影响查询召回率和速度。此值应大于或等于 k (查询返回结果数量),过低可能导致召回不全。 |
m | 32 | HNSW 索引的邻居数量,影响索引存储大小和查询效率。此值通常在 16 到 64 之间,过低影响召回质量,过高增加存储和查询开销。 |
vector_dimensions | 1536 | 向量维度,需与模型生成的嵌入向量维度一致,确保向量能够正确存储和比较。 |
max_connections | 100 | PostgreSQL 最大连接数,根据 FastGPT 部署规模和并发请求量调整,避免连接池耗尽。 |
这两者互相约束的地方
MiniMax 204K 上下文长度与 PostgreSQL(pgvector) 的召回结果之间存在直接约束。当从 pgvector 召回多条知识段落时,这些段落的总长度加上用户查询、系统指令等,不能超过 204000 token 的上下文预算。如果召回内容过长,需要进行截断或精简,否则可能导致模型报错或性能下降。此外,模型引用上限 200000 token 意味着即使 pgvector 返回了大量相关内容,最终输入到模型中的知识库引用部分也不会超过此限制。索引参数如 ef_construction 和 ef_search 的调整,会影响 pgvector 的召回条数和召回质量。提高 ef_search 值可以增加召回条数或提高召回准确性,这可能导致模型输入内容增加,进而更频繁地触及 MiniMax 模型的上下文长度限制。因此,需要权衡 pgvector 的召回能力与 MiniMax 模型的输入容量。
容易做错的三处
- 日志中出现
Context window exceeded错误,原因是召回的知识段落总长度超出了 MiniMax 模型的上下文限制。 - 模型回答缺乏相关性,但 FastGPT 界面显示召回了大量知识,原因是
ef_search值设置过低,导致 pgvector 未能检索到最相关的向量。 - 知识库查询响应时间过长,原因是
ef_construction或m值设置过高,导致 HNSW 索引构建或查询开销过大。
怎么确认配好了
- 通过 FastGPT 的调试界面,观察每次 RAG 查询的实际输入 token 数量,确保其在 MiniMax 模型的上下文长度限制内。
- 执行一系列测试查询,检查 FastGPT 返回结果中引用的知识段落是否与用户意图高度相关,并记录每次查询的召回条数。
- 监控 PostgreSQL 数据库的 CPU、内存和 IO 使用率,确保在 FastGPT 负载下,数据库性能稳定,没有出现资源瓶颈。
- 检查 FastGPT 的系统日志,确认没有出现 pgvector 连接或查询相关的错误信息,如
connection refused或query timeout。