模型指南官方文档4 分钟阅读模型组合页

Hunyuan 256K 上下文 这一档模型配 OceanBase 的配置口径

Hunyuan 这一档模型具备 256000 的上下文长度(`maxContext`),这意味着模型在单次交互中能处理的输入信息总量较大,能够容纳更多的召回内容或复杂指令。引用上限(`quoteMaxToken`)为 192000,这是对引用内容总 token 量的硬性预算,用于确保引用内容不会超出

这一档模型的参数意味着什么

Hunyuan 这一档模型具备 256000 的上下文长度(maxContext),这意味着模型在单次交互中能处理的输入信息总量较大,能够容纳更多的召回内容或复杂指令。引用上限(quoteMaxToken)为 192000,这是对引用内容总 token 量的硬性预算,用于确保引用内容不会超出模型处理能力。工具调用(tool_calling)功能为 true,表明模型支持通过工具扩展能力,可以执行外部操作或获取实时信息。图片输入为 false,表示模型不直接接受图像作为输入。

配 OceanBase 要定哪些

配置项建议取法这样取的依据
OCEANBASE_URLob://user:pass@host:port/database数据库连接字符串标准格式,用于建立与 OceanBase 服务的连接。
ef_construction64影响 HNSW 图构建质量与检索速度的平衡,较高的值可以提高召回率但会增加构建时间。
m16HNSW 算法中每个节点的最大连接数,影响索引结构密度与检索性能,通常取 8-32。
recall_top_k5向量检索返回的相似度最高的前 k 条数据,与引用上限共同决定最终召回内容。
chunk_overlap200 字符分块时相邻文本块的重叠长度,有助于保持上下文连贯性,避免信息丢失。
SEEKDB_URLmysql://user:pass@host:port/databaseSEEKDB 与 OceanBase 兼容 MySQL 协议,配置方式相同。

这两者互相约束的地方

Hunyuan 256K 上下文模型与 OceanBase 向量库的配合需要关注多方面约束。召回条数与每段长度的乘积必须小于模型的总上下文预算,以确保所有召回内容都能被模型处理。引用上限以 token 计,而向量库返回的是按条数计的段落。具体是引用上限先触顶还是召回条数先触顶,取决于每个段落的平均 token 长度。如果段落较短,可能会先达到召回条数的上限;如果段落较长,则引用上限可能先被触发。此外,OceanBase 的索引参数,例如 ef_construction 和 m,调大后可以提高检索的准确性,这意味着模型能够获得更相关的上下文信息,进而可能提升模型的理解与生成质量。

容易做错的三处

  • 连接 OceanBase 失败,日志显示 SQLSTATE[HY000] [2002] Can't connect to local MySQL server through socket。原因:OCEANBASE_URL 中的主机或端口配置不正确,或者 OceanBase 服务未启动。
  • 模型输出的内容明显与召回内容无关或信息不全,且响应时间较长。原因:ef_construction 或 m 参数设置过低,导致向量检索的召回质量差,模型接收到的上下文相关性不足。
  • 模型返回的引用内容被截断,或提示 quoteMaxToken 限制。原因:检索到的段落总 token 量超过了 Hunyuan 模型的 192000 引用上限,需要调整 recall_top_k 或分块策略。

怎么确认配好了

  • 在 FastGPT 知识库管理界面上传文档,观察分块状态是否正常完成,并能通过关键词检索到相关分块。
  • 配置一个 Agent,使用 Hunyuan 256K 模型和 OceanBase 向量库,进行一次包含复杂RAG查询的对话,核对模型返回的引用内容是否准确且完整。
  • 在 OceanBase 数据库监控界面,观察向量检索请求的 QPS 和延迟,确保在预期负载下性能稳定。
  • 通过 FastGPT 的调试工具,查看每次对话的实际输入 token 数和引用 token 数,确认未超出 Hunyuan 模型的上下文长度和引用上限。

参考资料