模型指南官方文档4 分钟阅读模型组合页

Gemini 1024K 上下文 这一档模型配 PostgreSQL(pgvector) 的配置口径

Gemini 1024K 上下文模型档位,其上下文长度高达 1024000 个 token,意味着在单次请求中可以处理极大量的输入信息,这直接影响到知识库召回内容的数量与详细程度。模型未标注单次最大输出,通常表示其输出长度具备高度灵活性,但仍需考虑实际应用中的性能与成本。1000000 的引用上限,

这一档模型的参数意味着什么

Gemini 1024K 上下文模型档位,其上下文长度高达 1024000 个 token,意味着在单次请求中可以处理极大量的输入信息,这直接影响到知识库召回内容的数量与详细程度。模型未标注单次最大输出,通常表示其输出长度具备高度灵活性,但仍需考虑实际应用中的性能与成本。1000000 的引用上限,为知识库RAG(检索增强生成)模式下,模型可以引用的外部段落数量设定了理论天花板。此外,支持图片输入和工具调用,表明该模型可以处理多模态数据并具备执行外部操作的能力,为复杂Agent场景提供了基础。

配 PostgreSQL(pgvector) 要定哪些

配置项建议取法这样取的依据
PG_URLpostgresql://user:password@host:port/database数据库连接的规范格式,确保FastGPT能正确连接到PostgreSQL实例。
ef_construction80HNSW索引构建时的参数,影响索引质量与构建速度;在m = 32时,此值可提供良好的召回性能。
ef_search60HNSW索引查询时的参数,影响召回精度与查询速度;此值在ef_construction相近时,可有效平衡性能与准确性。
m32HNSW图层中每个顶点的最大连接数,影响索引结构与查询效率;32是pgvector文档中推荐的常用值。
vector_ip_opstrue启用向量内积操作优化,适用于余弦相似度等距离计算,提升查询效率。
work_mem512MBPostgreSQL排序操作的内存限制,影响索引构建与查询性能,可根据服务器资源调整。

这两者互相约束的地方

Gemini 1024K 上下文模型的巨大上下文长度为RAG应用提供了广阔空间。然而,实际召回时,召回条数与每段召回内容长度的乘积,不能超过模型的上下文预算(1024000 token)。pgvector返回的向量数量,会受到FastGPT内部配置的召回条数限制,同时也不能超出模型的引用上限(1000000)。这意味着即使pgvector能返回大量结果,FastGPT也会根据引用上限进行截断。pgvector的ef_construction和ef_search参数调大,通常能提升召回的准确性,这对于需要模型从海量知识中精确提取信息的场景至关重要,能确保Gemini模型接收到更高质量的上下文输入。

容易做错的三处

  • 日志显示 ERROR: relation "public.vectors" does not exist:原因是没有正确创建pgvector所需的表或扩展。
  • 检索结果明显不相关或为空:原因可能是pgvector索引参数(如ef_search)设置过低,导致召回精度不足。
  • 模型返回的回答长度异常短或不完整:原因可能是FastGPT发送给模型的上下文总长度超过了Gemini模型的1024000 token上限。

怎么确认配好了

  • 检查FastGPT的系统日志,确认数据库连接成功,且没有关于pgvector操作的报错信息。
  • 在FastGPT知识库中上传文档,执行一次问答测试,观察模型是否能引用到正确的知识段落,并通过调整召回条数与每段长度,找到合适的阈值。
  • 通过PostgreSQL客户端工具,查询pg_stat_statements视图或pg_stat_activity,确认pgvector索引被有效利用,且查询耗时在可接受范围内,以此确定ef_search和ef_construction的合理阈值。

参考资料