这一档模型的参数意味着什么
MiniMax 模型的这一档配置,其上下文长度 maxContext 达到 204000 token,为处理大规模文本提供了充足空间。单次最大输出虽然未明确标注,但通常足以满足多数生成需求。引用上限 quoteMaxToken 设定在 200000 token,这意味着在单次模型调用中,用于引用外部检索内容的 token 总量不能超过此限制。引用上限是模型处理引用内容的预算,而向量库返回的段落条数是检索侧的输出量,两者在工程实践中需要协同考量。此外,这一档模型支持工具调用,可以集成外部服务和功能,但不具备图片输入能力。
配 openGauss 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OPENGAUSS_URL | postgresql://user:password@host:port/database | 数据库连接字符串,确保可访问 openGauss 实例 |
ef_construction | 64 | HNSW 索引构建参数,影响索引质量和构建速度 |
ef_search | 32 | HNSW 搜索参数,影响召回精度和查询延迟 |
m | 16 | HNSW 索引的邻居数量,影响内存占用和查询性能 |
| 每段召回字符数 | 500-800 字符 | 兼顾信息完整性与模型上下文窗口利用效率 |
| 召回条数 | 10-20 条 | 平衡召回广度与模型处理负荷 |
这两者互相约束的地方
这一档 MiniMax 模型的上下文长度为 204000 token,而引用上限为 200000 token。这意味着在将 openGauss 检索结果输入模型时,所有召回内容的 token 总和必须在引用上限之内。向量库的召回是按照段落条数计算的,而模型的引用上限是按 token 计量的。当每段文本较短时,模型可能因为达到最大召回条数而停止引用;当每段文本较长时,模型可能因为达到引用 token 上限而停止引用。因此,召回条数与每段长度的乘积必须小于模型的上下文预算。openGauss 的 ef_construction 和 ef_search 参数调大,可以提升召回精度,为模型提供更相关的上下文,从而更好地利用模型的引用上限。
容易做错的三处
- 日志显示
context window exceeded:原因可能是召回条数过多或每段文本过长,导致引用内容总 token 超过了模型的引用上限。 - 检索结果返回为空或条数不足:原因可能是 openGauss 的
ef_search参数设置过低,导致搜索精度不足,未能召回足够的相关文档。 - 模型回答质量不佳,缺乏相关性:原因可能是 openGauss 的 HNSW 索引参数
m或ef_construction设置不当,导致向量索引质量不高,影响了召回内容的准确性。
怎么确认配好了
- 通过 FastGPT 调试界面,观察模型每次引用内容的 token 计数,确保其稳定在 200000 token 引用上限以下。
- 对 openGauss 数据库执行基准测试,监控
SELECT查询的平均延迟,确保在可接受范围内。 - 随机选取若干用户查询,检查 openGauss 返回的召回文档内容,判断其与查询的相关性是否达到预期,并根据实际业务场景调整
ef_search参数。 - 在 FastGPT 知识库中上传大量文档后,检查 openGauss 索引构建过程的日志,确保
ef_construction和m参数配置下索引能稳定构建完成。