模型指南官方文档4 分钟阅读模型组合页

Qwen 32K 上下文 这一档模型配 OceanBase 的配置口径

Qwen 32K 这一档模型,其 `maxContext` 值为 32000 token,这决定了单次请求中模型可以处理的最大输入长度,包括用户查询、历史对话以及召回内容。模型单次最大输出长度未明确标注,通常这意味着在实际应用中会受到下游系统或平台默认值的限制。`quoteMaxToken` 设定为

这一档模型的参数意味着什么

Qwen 32K 这一档模型,其 maxContext 值为 32000 token,这决定了单次请求中模型可以处理的最大输入长度,包括用户查询、历史对话以及召回内容。模型单次最大输出长度未明确标注,通常这意味着在实际应用中会受到下游系统或平台默认值的限制。quoteMaxToken 设定为 30000 token,这限制了模型在生成回复时可以引用的召回内容的总体 token 预算。引用内容的段落数量由检索系统的配置决定。此档模型支持工具调用 true,允许其通过外部工具扩展能力。不支持图片输入 false,表示无法直接处理图像数据。

配 OceanBase 要定哪些

配置项建议取法这样取的依据
OCEANBASE_URLob://user:pass@host:port/db连接 OceanBase 数据库的唯一入口,格式需符合驱动要求。
ef_construction100–200索引构建时邻居节点的数量,影响召回质量与索引速度的平衡。
m16HNSW 图中每个节点的最大连接数,影响召回性能和内存占用。
recall_top_k5–10向量检索时返回的相似度最高条目数,影响召回内容范围。
segment_length200–500 字符单个文本段的推荐长度,影响引用内容的粒度。
embedding_model_dim1536向量维度需与所使用的 embedding 模型输出维度一致。

这两者互相约束的地方

Qwen 32K 模型的 maxContext 为 32000 token,这意味着所有输入内容的总和必须控制在此范围内。向量库召回的段落数量与每个段落的长度相乘,必须小于或等于这个上下文窗口。quoteMaxToken 设定为 30000 token,这是模型用于引用召回内容的预算。向量库返回的是固定数量的段落,而这些段落转换为 token 后的总和受到 quoteMaxToken 的限制。当单个段落较长时,即使召回条数不多,也可能迅速触及 quoteMaxToken 上限;反之,若段落较短,则可以引用更多条目。将 OceanBase 的 ef_construction 和 m 等索引参数调大,通常会提高召回的准确性,这对于 Qwen 模型在更精准的召回内容基础上进行推理是有利的,但也可能增加索引构建的时间和查询延迟。

容易做错的三处

  • 日志中出现 connection refused 错误,原因是 OCEANBASE_URL 配置中的主机或端口信息不正确。
  • 检索结果中的 score 字段异常,原因可能是 embedding_model_dim 与实际 embedding 模型维度不匹配,导致向量不兼容。
  • 检索返回的条目数远少于预期,原因在于 recall_top_k 设置过低,限制了向量库的召回范围。

怎么确认配好了

  • 通过 FastGPT 界面发起测试,观察模型回复是否流畅且引用内容准确,评估其与用户期望的契合度。
  • 检查 OceanBase 的慢查询日志,确认向量检索操作的耗时是否在可接受范围内。
  • 在 FastGPT 的调试界面,查看单次请求的 maxContext 占用情况,确保召回内容未超过上下文窗口限制。
  • 模拟高并发场景,观察 OceanBase 的 CPU 和内存使用率,确保系统在高负载下仍能稳定运行。

参考资料