模型指南官方文档4 分钟阅读模型组合页

Hunyuan 6K 上下文 这一档模型配 OceanBase 的配置口径

`hunyuan-turbo-vision` 模型具有 6000 token 的上下文长度,这意味着单次请求中可以处理的总输入文本量(包括指令、历史对话和检索内容)上限为 6000 token。引用上限同样设定为 6000 token,它限定了从知识库召回并用于生成回答的引用内容所能占据的 toke

这一档模型的参数意味着什么

hunyuan-turbo-vision 模型具有 6000 token 的上下文长度,这意味着单次请求中可以处理的总输入文本量(包括指令、历史对话和检索内容)上限为 6000 token。引用上限同样设定为 6000 token,它限定了从知识库召回并用于生成回答的引用内容所能占据的 token 总数。因此,引用内容的长度直接受此约束。引用内容的段落条数由检索侧的返回条数决定,两者是不同的量。模型支持图片输入,可处理多模态信息,但不支持工具调用能力。

配 OceanBase 要定哪些

配置项建议取法这样取的依据
OCEANBASE_URLob://user:password@host:port/database连接 OceanBase 数据库的必要凭证,确保指向正确的实例。
ef_construction100–200影响 HNSW 索引的构建质量与查询速度,数值越大,索引质量越高,召回更精准。
m16HNSW 索引中每个节点的最大连接数,影响召回效率与内存占用。
recall_max_segments前 5 条向量库单次召回的最大段落数量,直接影响送入模型的内容量。
segment_max_tokens800–1200知识库中每个文本段落的最大 token 长度,避免单个段落过长超出模型处理能力。

这两者互相约束的地方

模型上下文长度与向量库召回内容之间存在直接约束。当 recall_max_segments 乘以 segment_max_tokens 的结果接近或超过模型的 6000 token 上下文预算时,系统可能因为输入过长而截断内容或引发错误。引用上限 6000 token 按 token 数量进行限制,而向量库返回的是按条数计的段落。具体哪个限制先被触发,取决于每个召回段落的实际长度。例如,如果每个段落很短,即使召回多条也不会触及引用上限;如果段落很长,即使召回条数不多也可能迅速达到引用上限。OceanBase 的 ef_construction 和 m 等索引参数调大后,向量检索的精度会提升,这意味着召回的段落与查询的相关性更高,但同时可能增加索引构建和查询的资源消耗,需要权衡。

容易做错的三处

  • OCEANBASE_URL 配置错误导致连接失败,日志显示 SQLSTATE[HY000] [2002] Connection refused。
  • 召回条数与段落长度乘积超过 6000 token 引用上限,导致模型返回内容不完整或截断提示。
  • ef_construction 或 m 参数设置过小,导致检索结果相关性差,用户反馈回答质量不高。

怎么确认配好了

  • 检查 FastGPT 界面中 OceanBase 连接状态,确认显示“连接成功”。
  • 提交一个长查询,观察模型返回的引用内容是否完整,并检查引用内容的总 token 数是否符合 6000 token 的限制。
  • 针对特定问题进行多轮对话测试,评估模型回答的相关性,以此确定 ef_construction 和 m 等参数的合理阈值。

参考资料