模型指南官方文档4 分钟阅读模型组合页

Qwen 256K 上下文 这一档模型配 OceanBase 的配置口径

这一档模型具备 256000 token 的上下文长度(`maxContext`),这意味着单次交互中可容纳极大量的信息。引用上限(`quoteMaxToken`)也设定为 256000 token,这是引用内容可消耗的 token 预算。引用内容的总 token 量受到此限制。段落条数由检索结果决

这一档模型的参数意味着什么

这一档模型具备 256000 token 的上下文长度(maxContext),这意味着单次交互中可容纳极大量的信息。引用上限(quoteMaxToken)也设定为 256000 token,这是引用内容可消耗的 token 预算。引用内容的总 token 量受到此限制。段落条数由检索结果决定,这与引用上限是两个独立的量。工具调用能力(tool_code)为 true,支持通过函数调用扩展模型能力。图片输入(image_input)为 false,当前版本不支持直接处理图像输入。

配 OceanBase 要定哪些

配置项建议取法这样取的依据
OCEANBASE_URLob://user:pass@host:port/database连接 OceanBase 实例的必要信息,确保数据库可达。
ef_construction64HNSW 索引构建参数,影响索引质量与构建速度的平衡点。
m16HNSW 索引的邻居数量参数,影响召回精度与查询效率。
search_k按实测标定检索阶段的候选邻居数,需根据实际查询性能和精度要求调整。
vector_dimension1536向量维度需与 Embedding 模型输出维度保持一致。
chunk_size800–1200 字符单个文档块的推荐长度,平衡语义完整性与检索效率。

这两者互相约束的地方

模型上下文长度与向量库召回结果之间存在紧密关联。向量库返回的段落条数与每段内容的长度决定了总的召回内容量。这个总量不能超过模型的上下文预算。引用上限按 token 计,向量库返回的按条数计。当单段内容较短时,可能在达到引用上限之前就已召回大量段落。当单段内容较长时,可能在召回少量段落后即触及引用上限。OceanBase 的索引参数 ef_construction 和 m 值调大后,向量检索的精度会提升,召回更相关的段落,这有助于在有限的引用上限内提供更高质量的上下文给模型。

容易做错的三处

  • 日志显示 Connection refused:OCEANBASE_URL 配置错误或 OceanBase 实例未启动。
  • 检索结果为空或不相关:ef_construction 和 m 参数设置过低,导致 HNSW 索引质量不佳。
  • 模型输出内容过短或不完整:引用上限的 token 预算不足,导致模型未能接收到足够的上下文信息。

怎么确认配好了

  • 检查 OceanBase 数据库连接状态,确保 OCEANBASE_URL 配置正确且可访问。
  • 运行小型测试集,验证向量检索结果的召回率和相关性是否达到预期,并根据 search_k 调整查询性能。
  • 监控模型实际处理的上下文 token 数量,确保引用内容的 token 总量在 quoteMaxToken 预算内。
  • 通过 FastGPT 平台界面观察 RAG 流程,确认检索到的段落数量和内容符合预期。

参考资料