模型指南官方文档4 分钟阅读模型组合页

Hunyuan 32K 上下文 这一档模型配 OceanBase 的配置口径

Hunyuan 32K 上下文模型提供了 32000 token 的上下文长度,这意味着在单次对话中,模型可以处理包含更多历史对话和召回内容的请求。引用上限同样为 32000 token,这限定了模型在生成回复时可以引用的外部知识内容的总 token 预算。引用内容的段落条数由检索侧的返回数量决定,

这一档模型的参数意味着什么

Hunyuan 32K 上下文模型提供了 32000 token 的上下文长度,这意味着在单次对话中,模型可以处理包含更多历史对话和召回内容的请求。引用上限同样为 32000 token,这限定了模型在生成回复时可以引用的外部知识内容的总 token 预算。引用内容的段落条数由检索侧的返回数量决定,与引用上限是两个独立的考量维度。此档模型不具备图片输入和工具调用能力,因此在构建 Agent 流程时,需要将图片处理和外部功能调用逻辑置于模型调用之外。

配 OceanBase 要定哪些

配置项建议取法这样取的依据
OCEANBASE_URLmysql://user:pass@host:port/db连接 OceanBase 数据库的完整 JDBC 兼容 URL,确保 FastGPT 可以访问。
ef_construction64HNSW 索引构建参数,影响索引质量与构建速度。较高的值能提升召回准确度,但会增加索引构建时间。
m16HNSW 索引参数,表示每个节点的最大邻居数。此值影响搜索精度和内存占用。
chunk_size500–800 字符文本切片时的平均字符数,影响单段召回内容的粒度。
recall_count3–5 条向量检索时返回的段落数量,直接影响模型可引用的信息量。

这两者互相约束的地方

模型 32000 token 的上下文预算是所有输入内容的总和。向量库召回的段落总字符数乘以每段的 token 转换比例,不能超过这个上限。引用上限同样按 token 计量,而向量库返回的是按条数计量的段落。具体是引用上限先触顶还是召回条数先触顶,取决于每段召回内容的平均长度。如果单段内容较短,可能在达到引用上限前就能召回更多条;反之,若单段内容较长,则可能在召回少量条数后就达到引用上限。OceanBase 的 ef_construction 和 m 等索引参数调高,通常能提升召回准确度,为模型提供更相关的上下文,从而在有限的引用预算内,提高模型回答的质量。

容易做错的三处

  • 日志显示「OceanBase Connection Refused」,原因通常是 OCEANBASE_URL 中的主机或端口配置不正确,或数据库防火墙未开放。
  • 模型回复中引用的内容不完整或缺失关键信息,这往往是由于 chunk_size 过小导致关键信息被切分,或 recall_count 太少未能召回足够上下文。
  • 向量搜索响应时间过长,甚至超时,可能是因为 OceanBase 上的索引未正确创建,或 ef_construction 值设置过高导致索引构建和查询效率下降。

怎么确认配好了

  • 在 FastGPT 界面测试对话,观察模型回复是否能准确引用知识库内容,并检查引用的内容是否完整。
  • 在 OceanBase 数据库客户端执行向量查询,核对查询结果的召回条数和相关性,与预期是否一致。
  • 检查 FastGPT 运行日志,确保没有与 OceanBase 连接或查询相关的错误信息。
  • 通过 FastGPT 的调试功能,查看模型实际接收的上下文和引用内容,评估其是否在模型上下文和引用上限范围内。

参考资料