这一档模型的参数意味着什么
Gemini 系列的 1000K 上下文模型,其上下文长度 (maxContext) 达 1,000,000 token,这决定了单次模型调用能够处理的输入信息总量。引用上限 (quoteMaxToken) 为 1,000,000 token,此参数约束了模型在回答时可以引用的外部知识内容所占用的 token 预算。段落条数由检索系统的返回数量决定,与引用上限是两个独立的衡量维度。模型支持图片输入 (image_input: true),意味着可处理多模态查询;同时支持工具调用 (tool_calling: true),允许模型通过外部工具扩展其能力边界。
配 PostgreSQL(pgvector) 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PG_URL | postgresql://user:password@host:port/database | 数据库连接标准配置,确保网络可达与权限正确 |
ef_construction | 64–128 | 控制 HNSW 索引构建时的邻居搜索范围,影响索引质量与构建速度 |
ef_search | 32–64 | 控制 HNSW 索引查询时的邻居搜索范围,影响召回精度与查询速度 |
m | 32 | HNSW 索引中每个节点的最大连接数,影响索引大小与查询效率 |
vector_ip_ops | true | 使用内积距离(Inner Product)进行向量相似度计算,适用于特定场景 |
max_connections | 100–200 | 数据库最大并发连接数,需根据并发量与内存资源调整 |
这两者互相约束的地方
模型的 1,000,000 token 上下文预算是核心约束。从 PostgreSQL(pgvector)检索出的内容,无论是段落数量还是每段的平均长度,其合计 token 量都不能超出此预算。引用上限 quoteMaxToken 同样为 1,000,000 token,它限制了模型实际引用的外部知识内容所占用的 token 总量。向量库返回的是固定数量的段落,而模型引用的是这些段落转换成的 token。因此,当每段内容较短时,检索到的段落数量可能先达到上限;当每段内容较长时,总 token 数可能先触及引用上限。PostgreSQL(pgvector)的索引参数 ef_construction 和 ef_search 调大,通常会提升向量检索的召回精度,这意味着模型输入端能获得更高质量的相关内容,从而有助于模型在丰富的语料中进行更精确的理解与生成。
容易做错的三处
- 日志显示
context_exceeded错误:检索出的内容加上用户输入,总 token 数超过了模型的maxContext。 - 返回结果中引用内容缺失或不完整:向量库返回的段落经压缩或截断后,总 token 数仍超出
quoteMaxToken。 - 向量检索耗时过长,导致接口超时:PostgreSQL(pgvector)的
ef_search设置过大或硬件资源不足,导致查询效率低下。
怎么确认配好了
- 执行一次包含大量上下文的查询,并检查 API 返回中
usage.total_tokens字段,确认未超出模型maxContext。 - 通过 FastGPT 调试界面查看模型引用的具体内容,并评估其相关性和完整性,检查是否满足
quoteMaxToken预算。 - 在数据库层面监控 PostgreSQL(pgvector)的查询日志和性能指标,确认向量检索的 P95 延迟符合预期。
- 运行一系列包含不同类型和长度输入的测试案例,观察模型的响应质量和一致性,并结合实际业务场景标定合格阈值。