模型指南官方文档4 分钟阅读模型组合页

Qwen 128K 上下文 这一档模型配 OceanBase 的配置口径

Qwen 128K 上下文这一档模型,其上下文长度(`maxContext`)为 128000 token,这意味着模型单次请求能够处理的输入信息总量较大。引用上限(`quoteMaxToken`)为 50000 token,这是 FastGPT 在生成回答时,从知识库中召回并注入到模型提示词中的引

这一档模型的参数意味着什么

Qwen 128K 上下文这一档模型,其上下文长度(maxContext)为 128000 token,这意味着模型单次请求能够处理的输入信息总量较大。引用上限(quoteMaxToken)为 50000 token,这是 FastGPT 在生成回答时,从知识库中召回并注入到模型提示词中的引用内容所能占用的最大 token 预算。它不限定引用的条数,而是限定引用内容的总体积。工具调用支持意味着模型能够与外部工具进行交互以完成特定任务,而图片输入为 false 则表明模型不具备直接处理图像信息的能力。

配 OceanBase 要定哪些

配置项建议取法这样取的依据
OCEANBASE_URLob://user:password@host:port/database连接 OceanBase 实例的完整 URL,包含认证信息。
ef_construction64HNSW 索引构建时的邻居数量,影响索引质量与构建速度。
m=1616HNSW 索引中每个节点的最大连接数,影响召回精度与内存占用。
recall_top_k3–7每次检索从 OceanBase 返回的向量条数,需结合单条文档长度和引用上限调整。
chunk_size800–1200 字符单个文档块的建议长度,过长会降低检索精度,过短会增加召回条数。
max_connections按实测标定OceanBase 连接池的最大连接数,确保并发请求下的稳定性。

这两者互相约束的地方

Qwen 128K 上下文模型的 128000 token 上下文长度是总预算,其中 50000 token 专门用于引用内容。OceanBase 返回的是固定条数的向量段落。因此,召回条数乘以每段的平均 token 长度,必须控制在 50000 token 引用上限之内,且不应使总输入超过 128000 token。引用上限是 token 预算,而 OceanBase 返回的是段落条数,两者不是直接等价的量。究竟是引用上限先触顶,还是召回条数过多导致总上下文超限,取决于知识库中每段内容的实际长度。OceanBase 的 ef_construction 和 m 参数调大,通常会提高召回精度,但也可能增加索引构建时间与内存消耗,进而影响 FastGPT 整体的响应效率。SEEKDB 与 OceanBase 在配置口径上保持一致,可参考上述参数进行配置。

容易做错的三处

  • 检索日志显示 Context window exceeded:召回的条数过多,或者单条内容过长,导致引用内容的总 token 量超过了模型的引用上限。
  • 模型返回的回答中知识库内容缺失或不准确:ef_construction 或 m 参数设置过低,导致 OceanBase 向量检索精度不足,未能召回最相关的段落。
  • 数据导入或检索时出现 Connection refused 错误码:OCEANBASE_URL 配置有误,导致 FastGPT 无法连接到 OceanBase 实例。

怎么确认配好了

  • 在 FastGPT 知识库管理界面,上传多篇文档并观察切块后的文档长度是否符合预期。
  • 进行多次问答测试,观察模型返回的引用内容是否准确且数量适中,同时检查 FastGPT 运行日志中是否存在 Context window exceeded 警告。
  • 通过 OceanBase 监控工具,检查 ef_construction 和 m 参数调整后,查询响应时间与索引构建时间的波动情况,并根据实际负载设定合理的阈值。
  • 使用 OceanBase SQL 客户端工具,验证 OCEANBASE_URL 中提供的连接信息能够成功连接到数据库,并执行基本的查询操作。

参考资料