模型指南官方文档4 分钟阅读模型组合页

Qwen 1000K 上下文 这一档模型配 PostgreSQL(pgvector) 的配置口径

Qwen 系列模型中,上下文长度高达 1000000 意味着单次请求可处理极大体量的输入信息,这为复杂查询和多轮对话提供了充足的空间。引用上限 1000000 确保了在 RAG 场景下,可以从知识库中召回并整合海量的相关段落,以支持深度信息检索。图片输入能力允许模型直接理解图像内容,扩展了多模态应用

这一档模型的参数意味着什么

Qwen 系列模型中,上下文长度高达 1000000 意味着单次请求可处理极大体量的输入信息,这为复杂查询和多轮对话提供了充足的空间。引用上限 1000000 确保了在 RAG 场景下,可以从知识库中召回并整合海量的相关段落,以支持深度信息检索。图片输入能力允许模型直接理解图像内容,扩展了多模态应用的边界。工具调用支持则赋予模型执行外部动作的能力,使其能与外部系统进行交互,从而完成更复杂的任务流。这些参数共同定义了模型在处理大规模、多源信息和执行复杂任务时的性能边界。

配 PostgreSQL(pgvector) 要定哪些

配置项建议取法这样取的依据
PG_URLpostgresql://user:password@host:port/databaseFastGPT 连接 PostgreSQL 数据库的必要凭证,需包含完整的认证信息。
ef_construction64HNSW 索引构建时的邻居数量,影响索引质量和构建时间。此值在 16 到 200 之间通常能取得较好平衡。
ef_search40HNSW 索引查询时的搜索范围,影响召回精度和查询速度。通常建议 ef_search >= ef_construction。
m32HNSW 索引每层最大连接数,影响索引大小和查询性能。此值在 8 到 64 之间常见,32 是一个兼顾性能和资源消耗的常用值。
vector_ip_opstrue启用内积(Inner Product)操作符,适用于需要计算向量相似度的场景。

这两者互相约束的地方

模型上下文长度和引用上限直接影响了向量库的召回策略。对于 1000000 的上下文长度,理论上可以承载大量的召回内容。然而,实际召回条数还需受模型引用上限 1000000 的约束。这意味着即使向量库返回了大量段落,最终传递给模型的段落数量也应控制在引用上限之内。此外,召回条数乘以每段文本的平均长度,其总和不能超出模型的上下文长度限制,否则将导致模型输入截断或报错。向量库索引参数如 ef_search 调大,通常会提升召回精度,为模型提供更相关的上下文,但也可能增加查询延迟。因此,需要在召回精度和响应时间之间进行权衡,以匹配 FastGPT 系统的整体性能要求。

容易做错的三处

  • 日志显示 context window exceeded:原因在于向量库返回的段落总长度,加上用户输入,超出了模型的 1000000 上下文长度限制。
  • 界面上知识库引用部分为空白:原因可能是 ef_search 设置过低,导致向量库召回的相关段落不足,未能达到 FastGPT 设定的最小引用条数。
  • API 调用返回 500 Internal Server Error 且日志显示 database connection failed:原因通常是 PG_URL 配置错误,导致 FastGPT 无法连接到 PostgreSQL 数据库。

怎么确认配好了

  • 在 FastGPT 知识库中上传测试文档,并尝试进行问答,观察模型返回的引用段落是否符合预期,并检查 FastGPT 后台日志中是否有 PostgreSQL 相关的连接或查询错误。
  • 通过 FastGPT 的调试接口,模拟不同长度的用户输入和知识库召回条数,观察模型是否能稳定输出完整回答,并检查模型 token 使用量是否在预期范围内。
  • 使用 pg_stat_statements 或其他 PostgreSQL 监控工具,观察 pgvector 索引的查询性能指标,例如查询延迟和命中率,以确认 ef_search 和 m 等参数是否能提供可接受的响应时间。

参考资料