模型指南官方文档4 分钟阅读模型组合页

Groq 196K 上下文 这一档模型配 openGauss 的配置口径

此档模型具备 196608 token 的上下文长度,决定了单次请求中可携带的系统指令、用户输入与召回内容的总量。单次最大输出虽未明确标注,但通常足以支撑常见问答场景的响应长度。引用上限为 190000 token,用于限制模型在生成回答时可以参考的外部信息总量。引用内容是模型生成答案的依据,其总量

这一档模型的参数意味着什么

此档模型具备 196608 token 的上下文长度,决定了单次请求中可携带的系统指令、用户输入与召回内容的总量。单次最大输出虽未明确标注,但通常足以支撑常见问答场景的响应长度。引用上限为 190000 token,用于限制模型在生成回答时可以参考的外部信息总量。引用内容是模型生成答案的依据,其总量预算由此参数控制。工具调用能力的存在,意味着平台可以集成外部功能,允许模型在需要时执行特定操作。缺少图片输入能力,则表示此模型无法直接处理图像信息。

配 openGauss 要定哪些

配置项建议取法这样取的依据
OPENGAUSS_URLpostgresql://user:password@host:port/database数据库连接标准配置,确保 FastGPT 能正确连接 openGauss 实例
ef_construction128影响 HNSW 索引构建质量,过低导致召回率下降,过高增加构建时间
ef_search64影响 HNSW 搜索效率与召回率,需与 ef_construction 配合调优
m32HNSW 索引的图层最大连接数,影响索引大小与查询性能
vector_dimension1536向量维度,需与嵌入模型输出维度一致
max_connections100数据库最大并发连接数,防止连接池耗尽

这两者互相约束的地方

模型 196608 token 的上下文长度,是 FastGPT 召回内容与模型输入总和的上限。向量库返回的段落条数与每段长度的乘积,不能超出此上下文预算。引用上限 190000 token 是模型可以参考的外部内容总预算,以 token 计量。向量库检索结果按条数返回,如果每段内容较长,则少量条数就可能触及引用上限;如果每段内容较短,则可以引用更多条数。索引参数 ef_construction 和 ef_search 调大,通常会提升向量检索的召回准确性,这意味着模型可以获得更相关、更全面的引用内容,从而提高回答质量。然而,过高的参数也会增加 openGauss 的索引构建和查询开销。

容易做错的三处

  • 日志中出现 connection refused 错误,原因通常是 OPENGAUSS_URL 配置的数据库地址、端口或认证信息不正确。
  • 界面上模型返回的回答内容空泛,原因可能是向量库返回的段落数量过少或内容相关性不足,导致引用内容无法有效支撑模型生成答案。
  • 检索结果条数明显低于预期,原因是 ef_search 参数设置过低,导致 HNSW 索引在查询时没有充分探索邻居节点。

怎么确认配好了

  • 在 FastGPT 管理后台,尝试创建知识库并上传文档,观察是否能正常生成向量并入库,确认 OPENGAUSS_URL 配置有效。
  • 执行一次知识库问答,检查模型回答中引用的段落是否与问题高度相关,以此评估 ef_construction 和 ef_search 的效果。
  • 通过 openGauss 数据库的监控工具,查看向量查询的延迟和资源占用情况,确认索引参数设置未引起性能瓶颈,并以此为基准调整 ef_search 参数。
  • 在 FastGPT 调试界面,逐步增加召回条数,观察模型回答的质量变化,并结合引用内容的 token 计数,确定合适的召回条数上限。

参考资料