模型指南官方文档4 分钟阅读模型组合页

DeepSeek 64K 上下文 这一档模型配 OceanBase 的配置口径

DeepSeek 64K 上下文模型,其 `maxContext` 达 64000 token,表示模型单次处理的输入信息总量上限。这意味着在 RAG 场景中,可以容纳更多的召回内容,从而提升模型对复杂问题的理解能力。`quoteMaxToken` 引用上限为 60000 token,这是模型在生成

这一档模型的参数意味着什么

DeepSeek 64K 上下文模型,其 maxContext 达 64000 token,表示模型单次处理的输入信息总量上限。这意味着在 RAG 场景中,可以容纳更多的召回内容,从而提升模型对复杂问题的理解能力。quoteMaxToken 引用上限为 60000 token,这是模型在生成回答时,用于引用检索内容的 token 预算。它不直接决定引用的段落数量,而是限制了所有引用内容加起来的总大小。图片输入 false 表明该模型不支持直接处理图像信息,因此在构建多模态应用时需额外处理。工具调用 true 则表示模型支持 Function Calling 能力,可以与外部工具或 API 进行交互,实现更复杂的业务逻辑。

配 OceanBase 要定哪些

配置项建议取法这样取的依据
OCEANBASE_URLmysql://user:pass@host:port/db连接 OceanBase 数据库的唯一标识,遵循 MySQL 协议格式。
ef_construction64HNSW 索引构建时控制邻居数量的参数,影响索引质量与构建速度的平衡。
m16HNSW 索引中每个节点的最大出边数量,影响召回精度和存储开销。
chunk_size800–1200 字符文本切块的理想长度,兼顾上下文完整性与召回粒度。
overlap_size100–200 字符文本切块间的重叠部分,有助于保留上下文连贯性。
recall_count前 5–10 条向量检索时返回的相似度最高的文档块数量。

这两者互相约束的地方

模型 64K 的上下文长度允许输入大量信息,但 quoteMaxToken 60000 token 明确了引用内容的预算。向量库 OceanBase 返回的是检索到的文档块数量,而每个文档块的长度由 chunk_size 决定。因此,recall_count × chunk_size 的总和必须在 quoteMaxToken 预算之内。如果 chunk_size 较大,即使 recall_count 不高,也可能迅速触及引用上限;反之,chunk_size 较小则可以检索更多文档块。OceanBase 的 ef_construction 和 m 参数调大可以提升检索精度,但也可能增加索引构建时间和存储空间。对于上下文预算充裕的 DeepSeek 模型,高精度的召回能更好地利用其理解能力,但需要权衡资源消耗。

容易做错的三处

  • 日志显示 Input token limit exceeded, max_tokens=64000:模型总输入 token 超出上限,通常是召回内容与提示词合计过长。
  • 界面返回的回答缺乏关键信息,但检索出的段落中包含:quoteMaxToken 设置过低,导致部分关键引用内容被截断。
  • 向量检索耗时过长,导致整个请求超时:OceanBase 的 ef_construction 或 m 设置过高,索引构建或查询效率下降。

怎么确认配好了

  • 通过 FastGPT 调试界面观察每次请求的 input_tokens 和 quote_tokens,确认其数值在预期范围内。
  • 在 OceanBase 数据库中执行 SHOW INDEX FROM your_table; 命令,检查 HNSW 索引的 ef_construction 和 m 参数是否与配置一致。
  • 使用 FastGPT 的检索测试功能,调整 recall_count 参数,观察不同召回条数下,模型回答的完整性和相关性变化,以此确定合适的召回数量。
  • 监控 OceanBase 的查询日志,分析平均查询延迟和索引命中率,确保检索性能符合要求。

参考资料