模型指南官方文档4 分钟阅读模型组合页

OpenAI 1000K 上下文 这一档模型配 PostgreSQL(pgvector) 的配置口径

上下文长度 1000000 意味着模型能够处理极长的输入序列,为 RAG 应用提供了充足的召回内容承载空间。单次最大输出未标注,通常表示模型在生成回答时没有硬性 token 限制,但实际输出长度仍受限于应用侧的配置。引用上限 1000000 指定了模型在生成回复时可引用的召回内容总 token 预算

这一档模型的参数意味着什么

上下文长度 1000000 意味着模型能够处理极长的输入序列,为 RAG 应用提供了充足的召回内容承载空间。单次最大输出未标注,通常表示模型在生成回答时没有硬性 token 限制,但实际输出长度仍受限于应用侧的配置。引用上限 1000000 指定了模型在生成回复时可引用的召回内容总 token 预算。引用内容的总 token 量是限制模型参考信息量的关键,而检索系统返回的段落数量则是一个独立变量。图片输入 true 表示模型能够理解并处理图像信息,为多模态应用提供了可能。工具调用 true 允许模型与外部工具交互,扩展了其处理复杂任务的能力。

配 PostgreSQL(pgvector) 要定哪些

配置项建议取法这样取的依据
PG_URLpostgresql://user:password@host:port/database数据库连接字符串,确保可达性与权限。
ef_construction80–120控制 HNSW 索引构建时的邻居搜索广度,影响索引质量与构建时间。
ef_search40–60控制 HNSW 索引查询时的邻居搜索广度,影响查询召回率与速度。
m32HNSW 索引的每个节点的最大邻居数量,影响索引存储与查询效率。
vector_ip_opstrue启用内积(Inner Product)操作符,适用于余弦相似度计算。
max_connections50–100数据库最大并发连接数,需根据并发请求量和服务器资源调整。

这两者互相约束的地方

这一档模型拥有 1000000 的上下文长度,使得其能够容纳大量的召回内容。在与 PostgreSQL(pgvector)结合时,需要确保从向量库中检索出的所有段落的总 token 数不超过模型的上下文预算。引用上限 1000000 是模型可用于生成回复的召回内容总 token 预算,而向量库返回的是固定数量的段落。当每段召回内容的平均长度较短时,可能会先达到向量库返回的最大条数限制,此时引用上限仍有余裕。反之,当每段召回内容较长时,即使向量库返回的段落数量不多,也可能迅速触及引用上限。PostgreSQL(pgvector)的 ef_construction 和 ef_search 等索引参数调大,通常意味着索引构建更耗时、占用更多资源,但查询召回率更高、更准确。对于这一档模型,更准确的召回有助于充分利用其高引用上限,提供更精准的回答。

容易做错的三处

  • 日志中出现 PG::ConnectionBad 错误,原因是没有正确配置 PG_URL 环境变量或数据库凭证。
  • 检索结果相关性差,但在向量库中存在相关文档,原因可能是 ef_search 参数设置过小,导致查询时未能充分探索邻近向量。
  • 模型返回的回答中引用的内容不完整或缺失,原因是在 FastGPT 侧的 RAG 配置中,单次召回内容总 token 量超出了模型的引用上限。

怎么确认配好了

  • 通过 FastGPT 的调试接口,观察每次检索请求的 SQL 查询日志,确认 ef_search 等参数是否按预期生效。
  • 执行一系列包含长文本的问答测试,检查模型返回的回答是否充分利用了召回内容,且引用的内容没有被截断,从而确认引用上限与召回条数的匹配度。
  • 监控 PostgreSQL 数据库的连接数和查询延迟,确保在并发请求压力下,数据库性能能够满足 FastGPT 的需求,并据此调整 max_connections 等参数。
  • 验证模型在处理多模态输入(如带有图片的查询)时,是否能正确识别并利用图片信息,确认图片输入功能正常。

参考资料