模型指南官方文档4 分钟阅读模型组合页

Ernie 32K 上下文 这一档模型配 openGauss 的配置口径

Ernie 32K 上下文模型档位,其 `maxContext` 为 32000 token,意味着单次请求可处理的总输入量上限。引用上限 `quoteMaxToken` 为 27000 token,这部分预算专用于承载从知识库检索到的引用内容。这意味着检索到的所有相关段落合并后的 token 数量

这一档模型的参数意味着什么

Ernie 32K 上下文模型档位,其 maxContext 为 32000 token,意味着单次请求可处理的总输入量上限。引用上限 quoteMaxToken 为 27000 token,这部分预算专用于承载从知识库检索到的引用内容。这意味着检索到的所有相关段落合并后的 token 数量,不应超出此限制。模型支持图片输入,可处理多模态场景。工具调用功能在此档位未开放,需通过外部逻辑实现。

配 openGauss 要定哪些

配置项建议取法这样取的依据
OPENGAUSS_URLpostgresql://user:password@host:port/database连接 openGauss 数据库实例的必要参数,确保服务可访问。
ef_construction100构建 HNSW 索引时的参数,影响索引质量和构建速度,此值在召回率与构建时间间取得平衡。
ef_search60查询 HNSW 索引时的参数,影响搜索精度和查询速度,此值在确保搜索质量的同时兼顾响应时间。
m32HNSW 索引中每个节点的最大连接数,影响索引结构紧密程度和查询性能。
每段文本长度500-800 字符兼顾单段语义完整性与模型处理效率,避免过长或过短的文本片段。
召回条数前 5-8 条结合模型引用上限与单段长度,确保引用内容在预算内且信息量充足。

这两者互相约束的地方

模型的总上下文预算(32000 token)是检索内容和用户输入的总和。其中,引用上限(27000 token)专门用于知识库检索结果。向量库 openGauss 返回的是独立的段落条数,而模型的引用上限是按 token 计量的。这意味着,最终被模型引用的内容量,取决于每段文本的平均 token 长度以及实际召回的条数。如果每段文本较长,即使召回条数不多,也可能率先触及引用上限。反之,如果每段文本较短,则可以召回更多条数。调整 openGauss 的索引参数,如 ef_construction 和 ef_search,可以提高检索准确性,从而为模型提供更相关的上下文,但更高的准确性也可能伴随更长的检索时间。

容易做错的三处

  • 日志显示 context window exceeded:原因通常是检索到的内容总 token 数加上用户输入超出了模型的 maxContext。
  • 检索结果为空或不相关:原因可能是 ef_search 参数设置过低,导致搜索精度不足,未能找到相关向量。
  • 模型回答缺乏细节或关键信息缺失:原因多为检索到的段落总 token 数接近 quoteMaxToken 上限,但单段长度过长导致实际召回条数过少,未能覆盖必要信息。

怎么确认配好了

  • 执行一系列带知识库的查询,观察模型输出是否能准确引用源文档内容,并检查 quoteMaxToken 的实际使用量是否在预期范围内。
  • 通过监控 openGauss 的查询日志,确认每次检索的响应时间是否符合业务要求,并检查 ef_search 和 ef_construction 参数对查询性能的影响。
  • 针对不同长度的查询,观察模型在不同召回条数下的表现,评估当前每段文本长度和召回条数的组合是否平衡了信息量与模型引用预算。
  • 模拟极端情况下的长文本查询和大量召回,检查系统是否能稳定运行,并记录 maxContext 触达时的日志表现。

参考资料