模型指南官方文档4 分钟阅读模型组合页

Moonshot 128K 上下文 这一档模型配 OceanBase 的配置口径

Moonshot 128K 上下文这一档模型,其 128000 Token 的上下文长度决定了单次交互中可容纳的输入信息总量,包括用户提问、历史对话和知识库召回内容。60000 Token 的引用上限则设定了知识库召回内容在单次请求中可占据的最大Token量,直接影响了知识库引用的深度与广度。图片输

这一档模型的参数意味着什么

Moonshot 128K 上下文这一档模型,其 128000 Token 的上下文长度决定了单次交互中可容纳的输入信息总量,包括用户提问、历史对话和知识库召回内容。60000 Token 的引用上限则设定了知识库召回内容在单次请求中可占据的最大Token量,直接影响了知识库引用的深度与广度。图片输入能力意味着在多模态场景下,模型可以直接理解图像信息。工具调用能力的提供,则允许模型在生成回复时,通过外部工具执行特定操作,扩展了模型的应用边界。

配 OceanBase 要定哪些

配置项建议取法这样取的依据
OCEANBASE_URLmysql://user:password@host:port/databaseFastGPT 连接 OceanBase 的标准 MySQL 协议 URL 格式。
ef_construction64影响 HNSW 索引构建质量与查询速度,平衡建库时间与召回精度。
m16影响 HNSW 索引图的度,控制内存占用与查询性能。
top_k20向量库返回的相似度最高条数,为模型提供足够的候选引用。
文本分段长度500-800 字符确保每个分段包含足够信息且不超出模型单段处理能力。
召回策略相似度优先优先匹配与查询语义最相关的知识片段。

这两者互相约束的地方

Moonshot 128K 上下文模型与 OceanBase 向量库的配合,核心在于上下文长度的有效管理。知识库召回条数与每段文本长度的乘积,必须严格控制在模型 128000 Token 的上下文预算之内,同时不能超过 60000 Token 的引用上限。这意味着,即使 OceanBase 返回了大量相似条目,最终能被模型引用的数量也受限于此。当 OceanBase 的索引参数 ef_construction 或 m 调大时,通常会提升召回的精确度,但也可能增加查询延迟。对于模型而言,更精确的召回意味着能接收到更高质量的输入,但过高的延迟可能影响整体响应时间。因此,需要在这两者之间找到一个平衡点,确保模型能高效利用高质量的召回内容。

容易做错的三处

  • 模型返回 Context window exceeded 错误:原因在于知识库召回内容与用户输入总和超出了 128000 Token 的上下文限制。
  • 模型回答中知识引用不充分:原因可能是向量库 top_k 设置过低,导致召回条数不足以支撑复杂问题。
  • 知识库查询响应时间过长:原因可能是 OceanBase 索引参数 ef_construction 或 m 设置过大,导致查询计算量剧增。

怎么确认配好了

  • 在 FastGPT 知识库管理界面,上传文档并进行分段后,检查分段数量与平均长度是否符合预期。
  • 发起一个包含复杂问题的测试对话,观察模型返回的引用来源是否准确且数量合理。
  • 通过 FastGPT 的日志系统,监控每次知识库查询的响应时间,确保其在可接受范围内。
  • 在 OceanBase 数据库中,验证 HNSW 索引的构建状态,并检查 ef_construction 和 m 参数是否已正确应用。

参考资料