模型指南官方文档5 分钟阅读模型组合页

Gemini 1048K 上下文 这一档模型配 PostgreSQL(pgvector) 的配置口径

Gemini 1048K 上下文模型档位提供 1048576 token 的上下文长度,这意味着单次请求可以处理非常大的输入文本量,为复杂的RAG(检索增强生成)场景提供了充足的空间。单次最大输出未标注,通常由模型本身能力和实际使用场景决定。引用上限设定为 1000000 token,这笔预算专门用

这一档模型的参数意味着什么

Gemini 1048K 上下文模型档位提供 1048576 token 的上下文长度,这意味着单次请求可以处理非常大的输入文本量,为复杂的RAG(检索增强生成)场景提供了充足的空间。单次最大输出未标注,通常由模型本身能力和实际使用场景决定。引用上限设定为 1000000 token,这笔预算专门用于存放从知识库中检索到的相关内容,它严格限制了所有引用内容累计的 token 总量。段落条数由检索逻辑决定,与引用上限是两个独立维度。该档模型支持图片输入和工具调用,允许构建多模态和具备复杂交互能力的 AI Agent。

配 PostgreSQL(pgvector) 要定哪些

配置项建议取法这样取的依据
PG_URLpostgresql://user:password@host:port/databasePostgreSQL 数据库的标准连接字符串,确保可访问性和权限。
ef_construction64–128影响索引构建时的精度与速度。较大值能提升召回质量,但会增加索引构建时间。
ef_search40–80影响查询时的召回精度。较大值能提升搜索结果的准确性,但会增加查询延迟。
m32HNSW 索引中每个节点的最大连接数。影响索引大小和查询性能,32是平衡选择。
vector_ip_opstrue启用内积(Inner Product)操作,适用于需要计算向量相似度的场景。
max_connections100数据库最大并发连接数,根据应用负载和数据库性能进行调整。

这两者互相约束的地方

模型上下文长度是总容量,它需要容纳用户输入、系统指令、模型输出以及从向量库检索到的引用内容。引用上限按 token 计,而 PostgreSQL(pgvector)返回的是检索到的段落条数。当每段内容的 token 长度较短时,可能会检索到更多条段落,但只要总 token 数未超引用上限,模型即可处理。反之,若每段内容较长,即使条数不多,也可能迅速触及引用上限。因此,在配置检索策略时,需要平衡单段长度与召回条数,确保引用内容总 token 数在 1000000 token 预算内,且不超过模型总上下文长度 1048576 token。PostgreSQL(pgvector)的索引参数 ef_construction 和 ef_search 调大,意味着向量检索的精度会提高,模型能获得更相关的引用内容,从而提升生成质量,但这也会增加索引构建时间和查询延迟。

容易做错的三处

  • 日志显示 ERROR: pq: too many connections:原因在于 PostgreSQL 数据库的 max_connections 参数设置过低,无法支撑应用并发请求。
  • 模型回答内容与期望事实不符,但检索出的段落条数正常:原因可能是 pgvector 的 ef_search 参数设置过小,导致召回的向量虽然数量足够,但相关性不足。
  • RAG 流程执行超时,且数据库 CPU 使用率高:原因可能是 HNSW 索引的 ef_construction 或 ef_search 参数设置过大,导致索引构建或查询计算量过高。

怎么确认配好了

  • 执行一次包含复杂查询的 RAG 流程,检查日志中是否存在数据库连接错误或查询超时。
  • 通过 FastGPT 界面查看模型输出,并对照引用的知识片段,评估引用内容的相关性与完整性,确定 ef_search 参数是否合适。
  • 监控 PostgreSQL 数据库的 CPU、内存及 I/O 使用率,尤其是在索引构建和高并发查询时,以判断 ef_construction 和 m 参数是否合理。
  • 在 FastGPT 平台测试不同长度的用户输入,观察模型是否能稳定处理,并确保引用内容总 token 未超 1000000 的预算。

参考资料