模型指南官方文档3 分钟阅读模型组合页

Hunyuan 6K 上下文 这一档模型配 OceanBase 的配置口径

Hunyuan 这一档模型具备 6000 token 的上下文长度,这意味着在单次交互中可以处理的总文本量上限。引用上限为 4000 token,这部分预算专用于承载从知识库中检索到的引用内容。引用上限是模型处理引用内容的总量约束,而具体召回的段落条数由检索逻辑决定。图片输入功能的存在,表明该模型支

这一档模型的参数意味着什么

Hunyuan 这一档模型具备 6000 token 的上下文长度,这意味着在单次交互中可以处理的总文本量上限。引用上限为 4000 token,这部分预算专用于承载从知识库中检索到的引用内容。引用上限是模型处理引用内容的总量约束,而具体召回的段落条数由检索逻辑决定。图片输入功能的存在,表明该模型支持多模态输入,能够处理包含图像的请求。工具调用功能未启用,表示该模型不直接支持通过内部机制调用外部工具执行特定操作。

配 OceanBase 要定哪些

配置项建议取法这样取的依据
OCEANBASE_URLob://user:pass@host:port/database连接 OceanBase 实例的必要信息,确保数据库可访问。
ef_construction80控制 HNSW 索引的构建质量,提高召回精度与构建速度的平衡点。
m16HNSW 索引中每个节点的最大连接数,影响召回效率和内存占用。
召回条数3-5 条结合模型引用上限与单段平均长度,确保引用内容有效利用模型预算。
单段最大字符数800-1200 字符避免单段过长,超出模型处理能力或导致信息冗余。
检索匹配阈值0.75-0.85平衡召回的精确性与召回率,减少不相关内容的引入。

这两者互相约束的地方

模型上下文长度是总输入量的上限,召回条数与每段长度的乘积,加上用户提问和系统指令的 token 数,必须在此上限内。引用上限是模型专门用于处理检索内容的 token 预算。当向量库返回多段内容时,这些内容的 token 总和需要控制在引用上限之内。引用上限限制的是引用内容的整体 token 量,而向量库返回的是固定条数。具体能引用多少条,取决于每段内容的平均 token 长度。如果索引参数,例如 ef_construction 和 m 值调大,向量搜索的召回质量通常会提高,这可能意味着召回的段落更具相关性,从而更好地利用模型的引用上限。

容易做错的三处

  • 查询结果返回空,但知识库中明明有相关文档:可能是检索匹配阈值设置过高,导致相关文档被过滤。
  • 模型回答内容过短或不完整,且日志显示引用内容被截断:引用的内容总 token 数超出了模型的 quoteMaxToken 上限。
  • 向量搜索耗时过长,影响整体响应速度:OceanBase 的 ef_construction 或 m 参数设置过大,导致索引构建或查询负担过重。

怎么确认配好了

  • 向知识库提问,检查模型回答中引用的内容是否与检索到的文档高度相关。
  • 观察日志输出,确认每次检索返回的条数与配置的召回条数是否一致。
  • 通过模拟高并发请求,评估 OceanBase 的向量搜索响应时间,确保其在可接受范围内。
  • 检查模型单次输出的 token 数量,确保其在 maxTokens 限制内,且回答内容完整。

参考资料