模型指南官方文档4 分钟阅读模型组合页

Hunyuan 256K 上下文 这一档模型配 openGauss 的配置口径

Hunyuan 256K 模型的 `maxContext` 达 256000,表明其能够处理极为庞大的输入文本,为RAG(检索增强生成)任务提供了宽裕的召回内容承载空间。`quoteMaxToken` 为 192000,意味着引用内容在总输入中的预算上限。模型支持工具调用 (`tool_callin

这一档模型的参数意味着什么

Hunyuan 256K 模型的 maxContext 达 256000,表明其能够处理极为庞大的输入文本,为RAG(检索增强生成)任务提供了宽裕的召回内容承载空间。quoteMaxToken 为 192000,意味着引用内容在总输入中的预算上限。模型支持工具调用 (tool_calling: true),可以与外部工具集成,扩展其功能。不支持图片输入 (image_input: false),在多模态场景下需要额外处理。单次最大输出未标注,但在实际应用中通常会有一个隐式或显式的限制,需要通过实验确定。

配 openGauss 要定哪些

配置项建议取法这样取的依据
OPENGAUSS_URLpostgresql://user:password@host:port/database连接 openGauss 数据库实例的统一资源定位符
ef_construction100影响索引构建时的图连接数,越大召回质量越高,构建时间越长
ef_search64影响查询时的图遍历深度,越大召回质量越高,查询延迟越高
m32影响 HNSW 图的层间连接数,是 HNSW 算法的核心参数之一,通常取 16 到 64
top_k5向量检索返回的条目数量,需要与模型 quoteMaxToken 协同
chunk_size800 字符单个文本块的建议长度,影响召回效率与模型理解度

这两者互相约束的地方

模型的 maxContext 为 256000,这意味着召回条数与每段长度的乘积,加上查询本身和其他系统提示词,必须控制在这个总预算之内。quoteMaxToken 192000 是专门用于引用内容的 token 预算。向量库返回的是固定数量的段落条数,而模型的引用上限是 token 预算,两者不是直接的等价关系。当每段文本较长时,即使返回条数不多,也可能迅速触及 quoteMaxToken 上限;反之,如果每段文本较短,则可以召回更多条目。openGauss 的 ef_construction 和 ef_search 参数调大后,向量检索的召回质量会提高,为模型提供更相关的上下文,这对于充分利用 Hunyuan 256K 模型的长上下文能力至关重要,但同时也会增加索引构建和查询的资源消耗。

容易做错的三处

  • 日志显示 context window exceeded:召回的文本段落总长度加上用户输入,超出了模型的 maxContext。
  • 模型返回的回答内容简短,且未包含关键信息:quoteMaxToken 预算不足,导致有效引用内容被截断。
  • 向量检索结果质量不高,模型回答出现事实性错误:openGauss 的 ef_search 或 m 参数设置过小,导致检索准确性下降。

怎么确认配好了

  • 通过 FastGPT 界面发送一个长文本查询,观察模型是否能正确理解并引用所有相关信息。
  • 逐步增加检索的 top_k 值,同时监测模型返回的引用内容是否充分,并避免 context window exceeded 错误。
  • 在 openGauss 数据库中,通过 pg_stat_statements 观察向量查询的延迟,并与业务可接受的响应时间进行对比。
  • 使用不同长度的文本进行向量嵌入和查询,确认 openGauss 的索引性能在多种场景下均符合预期。

参考资料