模型指南官方文档4 分钟阅读模型组合页

Hunyuan 32K 上下文 这一档模型配 openGauss 的配置口径

Hunyuan 32K 上下文模型提供了 32000 token 的上下文长度,这决定了模型单次处理的输入信息总量。单次最大输出未标注,意味着其回答长度需根据实际应用场景进行合理限制。引用上限为 20000 token,这是对检索到的引用内容总量的预算,它限制了所有引用内容合计所占的 token 数

这一档模型的参数意味着什么

Hunyuan 32K 上下文模型提供了 32000 token 的上下文长度,这决定了模型单次处理的输入信息总量。单次最大输出未标注,意味着其回答长度需根据实际应用场景进行合理限制。引用上限为 20000 token,这是对检索到的引用内容总量的预算,它限制了所有引用内容合计所占的 token 数。段落条数由向量检索侧的配置决定,这两者是相互独立但又相互影响的量。此档模型不具备图片输入能力,也不支持工具调用,因此在设计 RAG 流程时需要避免依赖这些特性。

配 openGauss 要定哪些

配置项建议取法这样取的依据
OPENGAUSS_URLpostgresql://user:password@host:port/databaseFastGPT 连接 openGauss 数据库的连接字符串格式。
ef_construction100–200影响索引构建的质量与速度,提升召回精度。
ef_search80–150影响查询时的召回精度与速度,提升搜索效率。
m32HNSW 索引的图层连接数,影响索引结构和查询性能。
召回条数3–5 条在模型引用上限内,兼顾召回质量与上下文预算。
每段最大长度800–1200 字符避免单段过长导致 token 浪费,或单段过短丢失信息。

这两者互相约束的地方

模型 32000 token 的上下文长度是总输入量的硬性限制。向量库召回的条数乘以每段的平均长度,其总和必须在这个上下文预算之内。引用上限 20000 token 是对引用内容总量的预算,向量库返回的则是按条数计。谁先触及上限,取决于每段引用内容的平均长度。如果每段内容较短,模型可能因引用条数过多而达到上下文上限;如果每段内容较长,则可能因引用内容总 token 数过多而达到引用上限。openGauss 的 ef_construction 和 ef_search 参数调大,可以提高向量召回的精度,这意味着模型能获得更相关的上下文信息,从而提高回答质量。然而,更高的精度也可能带来更长的检索时间,需要权衡。

容易做错的三处

  • 日志显示 context_exceed_limit 错误:原因在于召回的文档总 token 数超过了模型的上下文长度限制。
  • 模型回复内容简短且不完整:原因可能是引用上限 20000 token 提前触顶,导致模型无法获得足够的参考信息。
  • 检索结果中出现大量不相关文档:原因是 openGauss 的 ef_search 或 ef_construction 参数设置过低,导致向量索引召回精度不足。

怎么确认配好了

  • 在 FastGPT 知识库中上传测试文档,并观察系统日志,确保 openGauss 索引构建过程无报错。
  • 使用 FastGPT 的调试功能,输入典型问题,检查模型返回的引用内容,确保引用内容与问题高度相关,且数量在合理范围内。
  • 通过 FastGPT 的 API 或 UI 进行多次问答测试,观察响应时间,并根据实际业务负载确定 openGauss 的 ef_search 和 ef_construction 阈值。
  • 在 FastGPT 知识库中检索特定关键词,核对 openGauss 返回的召回条数与预期配置是否一致。

参考资料