模型指南官方文档5 分钟阅读模型组合页

Qwen 260K 上下文 这一档模型配 OceanBase 的配置口径

Qwen 260K 上下文这一档模型,其上下文长度(`maxContext`)达到 260000 token,允许在单次交互中处理极大的输入量。引用上限(`quoteMaxToken`)为 260000 token,这意味着模型在生成回答时,可引用内容的总预算是 260000 token。段落条数由

这一档模型的参数意味着什么

Qwen 260K 上下文这一档模型,其上下文长度(maxContext)达到 260000 token,允许在单次交互中处理极大的输入量。引用上限(quoteMaxToken)为 260000 token,这意味着模型在生成回答时,可引用内容的总预算是 260000 token。段落条数由检索侧决定,引用内容总 token 量由段落条数和每段长度共同决定。模型支持工具调用(tool_calling=true),可以执行外部函数或 API,但不支持图片输入(image_input=false)。这些特性使得模型在处理复杂、长文本的 RAG 任务时具有显著优势。

配 OceanBase 要定哪些

配置项建议取法这样取的依据
OCEANBASE_URLob://user:password@host:port/database连接 OceanBase 数据库实例的统一入口,遵循 MySQL 协议兼容。
ef_construction100–200影响索引构建时的邻居数量,数值越大,索引质量越高,检索召回更精准。
m32HNSW 算法中最大邻居数量,影响索引的内存占用和查询速度。
recall_top_k前 5–10 条结合模型上下文长度,平衡召回质量与 token 消耗。
chunk_size800–1200 字符单个文本块的理想长度,兼顾信息完整性和检索效率。
vector_dimension按实测标定向量维度应与 embedding 模型输出维度保持一致。

说明:SEEKDB 与 OceanBase 使用同一套控制器实现,配置口径相同。

这两者互相约束的地方

模型上下文长度为 260000 token,这是模型单次处理所有输入(包括用户提问、系统指令和召回内容)的总限制。向量库返回的召回内容,其总 token 数不能超过这个限制。引用上限按 token 计,向量库返回的按条数计。当向量库返回多段内容时,每段内容的平均 token 数与召回条数的乘积,共同决定了引用内容的总 token 量。引用上限是 260000 token,它约束的是最终被模型引用的所有内容的总量。如果每段内容较短,可以引用更多的条数;如果每段内容较长,则能引用的条数会相应减少。索引参数如 ef_construction 和 m 调大后,向量检索的精度和召回质量会提高,可能导致召回内容更相关,进而影响模型对引用内容的理解和生成。

容易做错的三处

  • 日志显示 connection refused:OCEANBASE_URL 配置错误,导致无法连接 OceanBase 数据库。
  • 检索结果返回条数远低于预期:向量库索引未正确构建,或 recall_top_k 设置过小。
  • 模型回答内容缺乏相关性:chunk_size 过大或过小,导致向量召回的文本片段信息不足或冗余。

怎么确认配好了

  • 在 FastGPT 管理界面,测试知识库问答,检查模型回答是否能准确引用到知识库内容。
  • 观察模型推理日志,确认召回条数和引用 token 数是否在预期范围内。
  • 监测 OceanBase 数据库的 CPU 和内存使用率,确保在高并发查询下系统稳定运行。
  • 通过 FastGPT 的调试功能,查看每次问答的召回内容和 token 消耗,据此调整 recall_top_k 和 chunk_size。

参考资料