模型指南官方文档4 分钟阅读模型组合页

Gemini 1000K 上下文 这一档模型配 PostgreSQL(pgvector) 的配置口径

Gemini 系列的 1000K 上下文模型,其上下文长度 (`maxContext`) 达 1,000,000 token,这决定了单次模型调用能够处理的输入信息总量。引用上限 (`quoteMaxToken`) 为 1,000,000 token,此参数约束了模型在回答时可以引用的外部知识内容所

这一档模型的参数意味着什么

Gemini 系列的 1000K 上下文模型,其上下文长度 (maxContext) 达 1,000,000 token,这决定了单次模型调用能够处理的输入信息总量。引用上限 (quoteMaxToken) 为 1,000,000 token,此参数约束了模型在回答时可以引用的外部知识内容所占用的 token 预算。段落条数由检索系统的返回数量决定,与引用上限是两个独立的衡量维度。模型支持图片输入 (image_input: true),意味着可处理多模态查询;同时支持工具调用 (tool_calling: true),允许模型通过外部工具扩展其能力边界。

配 PostgreSQL(pgvector) 要定哪些

配置项建议取法这样取的依据
PG_URLpostgresql://user:password@host:port/database数据库连接标准配置,确保网络可达与权限正确
ef_construction64–128控制 HNSW 索引构建时的邻居搜索范围,影响索引质量与构建速度
ef_search32–64控制 HNSW 索引查询时的邻居搜索范围,影响召回精度与查询速度
m32HNSW 索引中每个节点的最大连接数,影响索引大小与查询效率
vector_ip_opstrue使用内积距离(Inner Product)进行向量相似度计算,适用于特定场景
max_connections100–200数据库最大并发连接数,需根据并发量与内存资源调整

这两者互相约束的地方

模型的 1,000,000 token 上下文预算是核心约束。从 PostgreSQL(pgvector)检索出的内容,无论是段落数量还是每段的平均长度,其合计 token 量都不能超出此预算。引用上限 quoteMaxToken 同样为 1,000,000 token,它限制了模型实际引用的外部知识内容所占用的 token 总量。向量库返回的是固定数量的段落,而模型引用的是这些段落转换成的 token。因此,当每段内容较短时,检索到的段落数量可能先达到上限;当每段内容较长时,总 token 数可能先触及引用上限。PostgreSQL(pgvector)的索引参数 ef_construction 和 ef_search 调大,通常会提升向量检索的召回精度,这意味着模型输入端能获得更高质量的相关内容,从而有助于模型在丰富的语料中进行更精确的理解与生成。

容易做错的三处

  • 日志显示 context_exceeded 错误:检索出的内容加上用户输入,总 token 数超过了模型的 maxContext。
  • 返回结果中引用内容缺失或不完整:向量库返回的段落经压缩或截断后,总 token 数仍超出 quoteMaxToken。
  • 向量检索耗时过长,导致接口超时:PostgreSQL(pgvector)的 ef_search 设置过大或硬件资源不足,导致查询效率低下。

怎么确认配好了

  • 执行一次包含大量上下文的查询,并检查 API 返回中 usage.total_tokens 字段,确认未超出模型 maxContext。
  • 通过 FastGPT 调试界面查看模型引用的具体内容,并评估其相关性和完整性,检查是否满足 quoteMaxToken 预算。
  • 在数据库层面监控 PostgreSQL(pgvector)的查询日志和性能指标,确认向量检索的 P95 延迟符合预期。
  • 运行一系列包含不同类型和长度输入的测试案例,观察模型的响应质量和一致性,并结合实际业务场景标定合格阈值。

参考资料