模型指南官方文档4 分钟阅读模型组合页

Moonshot 32K 上下文 这一档模型配 OceanBase 的配置口径

`moonshot-v1-32k-vision-preview` 模型具备 32000 token 的上下文长度,决定了单次交互中可处理的输入与输出总和。单次最大输出长度未明确标注,通常由模型本身动态调整。引用上限为 32000 token,这限制了召回内容可以占据的 token 总量。引用内容段落

这一档模型的参数意味着什么

moonshot-v1-32k-vision-preview 模型具备 32000 token 的上下文长度,决定了单次交互中可处理的输入与输出总和。单次最大输出长度未明确标注,通常由模型本身动态调整。引用上限为 32000 token,这限制了召回内容可以占据的 token 总量。引用内容段落数量由检索侧配置决定,与引用上限是两个独立维度。图片输入能力允许模型处理图像数据,扩展了输入类型。工具调用能力则支持模型与外部工具进行交互,实现更复杂的任务流程。

配 OceanBase 要定哪些

配置项建议取法这样取的依据
OCEANBASE_URLmysql://user:password@host:port/database连接 OceanBase 数据库的必要参数,遵循 MySQL 协议格式
ef_construction64HNSW 索引构建时的邻居数量,影响索引质量与构建速度,64 是常见优化起点
m16HNSW 索引中每个节点的最大连接数,影响检索性能与内存占用,16 是平衡设置
quoteMaxTokens8000预留给引用内容的 token 预算,确保模型有足够空间处理指令与生成回复
maxRetrieveCount5向量库单次检索返回的最大段落数量,平衡召回质量与上下文预算
chunkOverlap64分段时相邻文本块的重叠字符数,有助于保持上下文连贯性

这两者互相约束的地方

召回条数与每段文本长度的乘积必须小于或等于模型的上下文预算 32000 token。引用上限按 token 计费,而向量库返回的是按条数计量的文本段落。当单段文本较短时,引用上限可能先达到,限制了可引用的总文本量。当单段文本较长时,向量库返回的条数可能先达到限制。索引参数 ef_construction 和 m 调大,通常意味着向量索引的精度提升,检索到的内容与查询更相关。这对于模型来说,意味着能获得更高质量的召回内容,从而提升回答的准确性与相关性,但同时也会增加索引构建和查询的资源消耗。

容易做错的三处

  • 日志显示“上下文长度超出限制,请缩短输入或调整配置”:原因是对模型可接受的总 token 数估计不足,召回内容与用户输入总和超过 32000。
  • 检索结果为空或不相关:原因可能是 ef_construction 或 m 配置过小,导致 HNSW 索引质量不佳,无法有效召回相关向量。
  • 模型回答缺乏细节,未能充分利用知识库信息:原因是 quoteMaxTokens 配置过低,限制了模型可以引用的知识库内容总量。

怎么确认配好了

  • 上传文档后,检查 OceanBase 数据库中是否有新增的向量数据,并确认 ef_construction 和 m 参数是否已按预期生效。
  • 在 FastGPT 界面进行一次包含知识库的提问,观察模型回答中是否正确引用了知识库内容,并检查引用的文本段落数量。
  • 执行一系列长文本查询,查看模型是否能处理全部输入,并返回完整回答,以此评估 quoteMaxTokens 和 maxRetrieveCount 的配置是否合理。
  • 通过 FastGPT 的调试工具,检查每次请求的 token 消耗情况,确认输入、输出和引用部分的 token 使用量是否在预期范围内。

参考资料