模型指南官方文档4 分钟阅读模型组合页

OpenAI 200K 上下文 这一档模型配 PostgreSQL(pgvector) 的配置口径

此档模型提供高达 200000 token 的上下文窗口,这意味着单次交互中可容纳大量历史对话和召回信息。单次最大输出 token 未明确标注,但在实际应用中,模型会根据需求生成相应长度的回答。引用上限为 120000 token,这是对检索到的信息用于生成回复时的总预算,它限制了引用内容的总量。段

这一档模型的参数意味着什么

此档模型提供高达 200000 token 的上下文窗口,这意味着单次交互中可容纳大量历史对话和召回信息。单次最大输出 token 未明确标注,但在实际应用中,模型会根据需求生成相应长度的回答。引用上限为 120000 token,这是对检索到的信息用于生成回复时的总预算,它限制了引用内容的总量。段落条数由检索策略决定,与引用上限是两个独立维度。模型支持图片输入,允许在对话中处理视觉信息,并具备工具调用能力,可与外部系统集成,执行特定任务。

配 PostgreSQL(pgvector) 要定哪些

配置项建议取法这样取的依据
PG_URLpostgresql://user:password@host:port/database标准连接字符串,确保可访问性和权限
ef_construction64HNSW 索引构建参数,影响索引质量与构建速度的平衡,此值提供较好的召回率
ef_search64HNSW 索引查询参数,控制查询时遍历的邻居数,此值平衡召回率与查询速度
m = 3232HNSW 索引的邻居数,影响图的稠密程度,此值适用于高维向量
vector_ip_opstruepgvector 启用内积操作符,支持基于内积的相似度计算
检索条数10–20 条结合引用上限,避免单次召回内容过多超出模型预算

这两者互相约束的地方

召回的段落总 token 数与模型 200000 token 的上下文预算紧密相关,总和不能超出此限制。引用上限 120000 token 约束了最终用于生成回答的引用内容总量,这是按 token 计量的。向量库返回的则是独立的段落条数。当每段内容较短时,可能会召回更多段落才达到引用上限;而当每段内容较长时,较少的段落条数就可能触及引用上限。索引参数 ef_construction 和 ef_search 调大,通常会提高召回的准确性,确保模型能接收到更相关的上下文信息,从而提升回答质量。但过高的值也会增加索引构建和查询的资源消耗。

容易做错的三处

  • 日志中出现 ERROR: index row size exceeds maximum:ef_construction 或 m 值设置过大,导致索引构建时内存或磁盘空间不足。
  • 检索结果的 quote 字段为空,或仅包含少量内容:召回的条数过多,但每条内容过长,导致在达到引用上限 120000 token 时,实际可引用的段落数量不足。
  • 查询响应时间过长,甚至超时:ef_search 值设置过高,导致查询时遍历的邻居节点过多,影响检索性能。

怎么确认配好了

  • 在 FastGPT 知识库测试界面,上传文档并进行问答,观察模型返回的引用内容是否准确且数量合理。
  • 检查 PostgreSQL 数据库的 pg_stat_statements 视图,确认向量查询的 total_time 在可接受范围内。
  • 在模型推理日志中,确认每次请求的 prompt_tokens 和 completion_tokens 总和远低于 200000 token 的上下文限制。
  • 通过 FastGPT 的引用详情,观察引用的总 token 数是否接近 120000 token 引用上限,并评估召回内容的完整性。

参考资料