模型指南官方文档4 分钟阅读模型组合页

Moonshot 8K 上下文 这一档模型配 OceanBase 的配置口径

`moonshot-v1-8k` 模型提供 8000 token 的上下文长度,这意味着一次交互中可以处理的总 token 量。引用上限为 6000 token,这是模型在生成回答时可以参考的外部信息(即召回内容)的预算。段落条数由检索侧决定,引用上限限定的是这些内容在模型内部的 token 消耗。

这一档模型的参数意味着什么

moonshot-v1-8k 模型提供 8000 token 的上下文长度,这意味着一次交互中可以处理的总 token 量。引用上限为 6000 token,这是模型在生成回答时可以参考的外部信息(即召回内容)的预算。段落条数由检索侧决定,引用上限限定的是这些内容在模型内部的 token 消耗。工具调用功能表示该模型能够解析并执行预设的外部工具,支持复杂任务处理。图片输入功能为 false,表明该模型不直接支持视觉信息处理。

配 OceanBase 要定哪些

配置项建议取法这样取的依据
OCEANBASE_URLmysql://user:pass@host:port/databaseFastGPT 连接 OceanBase 的标准 MySQL 协议连接字符串
ef_construction64影响索引构建时的图连接度,平衡查询性能与索引大小
m16影响 HNSW 索引中每个节点的最大连接数,平衡召回质量与查询延迟
recall_max_tokens5000留出 1000 token 给模型指令和回答,确保引用内容在引用上限内
recall_top_k5结合单段平均 token 数,避免超出引用上限
chunk_overlap_size100 字符确保上下文衔接,提升召回内容完整性

这两者互相约束的地方

模型 8000 token 的上下文预算需要合理分配给系统指令、用户问题、召回内容和模型回答。引用上限 6000 token 对向量库返回的内容构成直接约束。向量库召回的按条数计,而引用上限按 token 计,当单段平均 token 数较高时,即使召回条数不多,也可能迅速触及引用上限。反之,如果段落较短,则可以召回更多条目。索引参数 ef_construction 和 m 调大,通常会提升向量检索的精度和召回质量。这意味着向量库能够返回更相关的文档段落,但同时也可能增加索引构建和查询的计算开销。在模型引用上限固定的情况下,提高召回质量有助于在有限的 token 预算内提供更高价值的引用信息。

容易做错的三处

  • 日志显示 SQLSTATE: 28000 错误:OCEANBASE_URL 中提供的数据库用户权限不足或密码错误,导致无法连接 OceanBase。
  • 检索结果中的引用内容为空或不相关:向量库的 ef_construction 或 m 参数设置过低,导致索引构建质量不佳,影响检索召回效果。
  • 模型回答经常被截断,且没有引用内容:recall_max_tokens 参数设置过高,导致召回内容占用过多上下文,挤占了模型生成回答的空间。

怎么确认配好了

  • 通过 FastGPT 后台的调试工具,观察模型请求的 context_length,确认召回内容总 token 数未超过 recall_max_tokens。
  • 在知识库管理页面,尝试上传不同长度的文档,观察分段结果和索引构建是否正常,并进行少量测试查询,确认返回的 top_k 条目与预期相关。
  • 运行一个包含工具调用的复杂查询,检查模型是否能正确解析工具请求,并观察 OceanBase 的查询日志,确认向量检索操作的延迟符合预期。

参考资料