模型指南官方文档4 分钟阅读模型组合页

Hunyuan 32K 上下文 这一档模型配 OceanBase 的配置口径

Hunyuan 32K 这一档模型具有 32000 token 的上下文长度,决定了单次请求中模型能处理的输入内容总量,包括用户提问与检索召回。模型单次最大输出长度未标注,意味着其输出能力主要受限于上下文总长度。引用上限为 20000 token,这是模型在生成回答时,可引用检索内容的 token

这一档模型的参数意味着什么

Hunyuan 32K 这一档模型具有 32000 token 的上下文长度,决定了单次请求中模型能处理的输入内容总量,包括用户提问与检索召回。模型单次最大输出长度未标注,意味着其输出能力主要受限于上下文总长度。引用上限为 20000 token,这是模型在生成回答时,可引用检索内容的 token 预算。这个预算限制的是所有被引用内容的合计 token 数。检索系统返回的段落条数与此预算是不同的量,段落条数由检索逻辑决定。此档模型不支持图片输入和工具调用,因此无法通过这些通道进行多模态或复杂任务编排。

配 OceanBase 要定哪些

配置项建议取法这样取的依据
OCEANBASE_URLob://user:password@host:port/database连接 OceanBase 实例的必要信息,通过 MySQL 协议兼容方式连接 SEEKDB 同理。
ef_construction100–150影响 HNSW 索引构建质量,过低召回率下降,过高索引构建慢。
m16HNSW 索引中每个节点的最大邻居数,影响查询性能与召回质量的平衡。
max_return_segments5检索阶段从 OceanBase 返回的最大段落数量,以避免过度召回。
segment_max_tokens800单个检索段落的最大 token 数,过长段落可能稀释关键信息。

这两者互相约束的地方

模型上下文预算与向量库召回内容之间存在直接约束。检索系统返回的段落条数乘以每段的平均长度,其总和不能超出模型的上下文长度限制。Hunyuan 32K 模型的引用上限按 token 计,而向量库返回的是按条数计。哪一个限制先触达,取决于每个检索段落的平均长度。如果段落较短,可能在达到引用上限 token 数之前,就已经返回了大量段落。反之,若段落较长,可能在返回少量段落后,引用上限 token 数就已用尽。OceanBase 的 ef_construction 或 m 等索引参数调大,通常意味着更精确的向量搜索结果,这对于模型理解复杂查询和生成高质量回复至关重要,但也会增加索引构建或查询的时间成本。

容易做错的三处

  • 调用模型时返回 Context window exceeded 错误,原因在于检索召回内容加上用户输入,总 token 数超过了 32000 的上下文长度。
  • 模型回答中引用内容缺失或不完整,原因在于实际引用的 token 数超过了 20000 的引用上限,导致部分内容被截断。
  • 检索结果召回条数与预期不符,原因在于 max_return_segments 配置项设置不当,限制了从 OceanBase 返回的段落数量。

怎么确认配好了

  • 发送一个长文本查询,检查模型是否能正常处理并生成回答,同时观察日志中 total_tokens 字段是否在 32000 预算内。
  • 通过 FastGPT 的调试界面,查看模型引用内容的 token 计数,确认其是否在 20000 引用上限内。
  • 在 FastGPT 中配置检索模块,并观察 OceanBase 返回的实际段落数量,检查 max_return_segments 是否按预期生效。
  • 执行一系列语义相似度查询,对比不同 ef_construction 和 m 参数下返回结果的相关性,以确定索引参数是否达到期望的召回质量。

参考资料