模型指南官方文档4 分钟阅读模型组合页

DeepSeek 64K 上下文 这一档模型配 OceanBase 的配置口径

DeepSeek 64K 上下文模型,其 `maxContext` 达 64000 token,意味着单次请求中可输入大量文本,为 RAG 场景提供了充足的上下文窗口。`quoteMaxToken` 引用上限为 60000 token,这是 FastGPT 在生成回答时,从召回内容中实际用于模型推理

这一档模型的参数意味着什么

DeepSeek 64K 上下文模型,其 maxContext 达 64000 token,意味着单次请求中可输入大量文本,为 RAG 场景提供了充足的上下文窗口。quoteMaxToken 引用上限为 60000 token,这是 FastGPT 在生成回答时,从召回内容中实际用于模型推理的 token 预算。它不直接限制召回的段落数量,而是限定了所有引用内容合计的 token 总量。单次最大输出未明确标注,通常由模型自身决定,但 FastGPT 平台会施加限制以避免资源耗尽。图片输入和工具调用功能均为 false,表明该模型不支持视觉输入和通过工具进行外部交互,RAG 应用需纯文本处理。

配 OceanBase 要定哪些

配置项建议取法这样取的依据
OCEANBASE_URLob://user:password@host:port/databaseOceanBase 连接协议与凭证,确保 FastGPT 能连接到数据库。
ef_construction64HNSW 索引构建参数,影响索引质量与构建速度,64 是一个兼顾性能与召回率的平衡点。
m16HNSW 索引图的邻居数量参数,影响召回精度与查询效率,16 为常用设置。
召回条数10–20 条结合 quoteMaxToken 和平均段落长度,避免超出引用预算。
单段最大字符数800–1000 字符确保每段内容足够完整,同时控制总 token 消耗。
向量维度1024需与 DeepSeek 模型使用的 embedding 向量维度一致。

这两者互相约束的地方

DeepSeek 64K 上下文模型与 OceanBase 向量库的配合,核心在于 quoteMaxToken 与召回条数、每段长度之间的平衡。模型的 quoteMaxToken 是一个固定的 token 预算,而 OceanBase 返回的是具体条数的文本段落。当每段文本较短时,可以在 quoteMaxToken 预算内召回更多条目;反之,若每段文本较长,则召回条数会相应减少。如果召回条数乘以每段文本的 token 数超出 quoteMaxToken,FastGPT 会截断召回内容以适应预算。OceanBase 的 ef_construction 和 m 等索引参数调大,通常能提高召回精度,但也可能增加索引构建时间和查询延时,需要权衡。

容易做错的三处

  • 日志显示 "Quote token budget exceeded",原因是召回的文本段落总 token 数超过了 quoteMaxToken。
  • 搜索结果相关性不佳,原因是 OceanBase 的 ef_construction 或 m 参数设置过小,导致 HNSW 索引召回精度不足。
  • 向量搜索请求超时,原因是 OceanBase 实例资源不足或索引参数设置过大,导致查询计算量过高。

怎么确认配好了

  • 在 FastGPT 知识库测试界面,上传文档并进行问答测试,观察召回内容是否完整且相关。
  • 检查 FastGPT 后台日志,确认没有出现与 quoteMaxToken 超出相关的警告或错误信息。
  • 通过 FastGPT 的调试功能,查看实际召回的段落数量和它们所占用的 token 数,确保在 quoteMaxToken 限制内。
  • 监控 OceanBase 的 CPU、内存和 I/O 使用率,确保在进行向量搜索时资源消耗在合理范围内。

参考资料