模型指南官方文档4 分钟阅读模型组合页

Qwen 256K 上下文 这一档模型配 PostgreSQL(pgvector) 的配置口径

Qwen 256K 上下文模型提供了宽裕的输入空间。上下文长度 256000 tokens 决定了单次请求中可以承载的指令、历史对话和召回内容的总体规模。引用上限 256000 tokens 则明确了用于承载知识库召回内容的预算。在 RAG 场景下,实际召回的段落总 token 数必须控制在此上限之

这一档模型的参数意味着什么

Qwen 256K 上下文模型提供了宽裕的输入空间。上下文长度 256000 tokens 决定了单次请求中可以承载的指令、历史对话和召回内容的总体规模。引用上限 256000 tokens 则明确了用于承载知识库召回内容的预算。在 RAG 场景下,实际召回的段落总 token 数必须控制在此上限之内。单次最大输出未标注意味着模型在生成回复时没有硬性长度限制,但实际输出长度仍受限于整体上下文长度。工具调用能力的开启,允许模型在需要时执行外部函数或 API,扩展了其处理复杂任务的边界。图片输入为 false,表示此档模型不支持直接处理图像信息。

配 PostgreSQL(pgvector) 要定哪些

配置项建议取法这样取的依据
PG_URLpostgresql://user:password@host:port/database数据库连接字符串,确保网络可达性与凭证正确
ef_construction64 到 128影响 HNSW 索引构建质量,过小召回率低,过大索引构建慢
ef_search32 到 64影响 HNSW 搜索时的召回精度,通常大于或等于 ef_construction
m32HNSW 图结构中每个节点的最大连接数,影响索引大小和查询性能
vector_ip_opstrue使用内积操作符加速向量相似度计算
max_connections按实测标定数据库最大连接数,需根据并发请求量和数据库资源调整

这两者互相约束的地方

Qwen 256K 上下文模型的上下文长度和引用上限,与 PostgreSQL(pgvector) 的检索结果直接关联。向量库返回的段落数量乘以每段内容的平均 token 数,其总和必须低于模型的上下文长度,以确保所有信息都能被模型处理。特别地,引用上限 256000 tokens 是对召回内容总量的预算,它独立于向量库返回的条数。这意味着,如果每段内容较短,可以返回更多条;如果每段内容较长,则返回的条数会相应减少,以避免超出引用上限。当 PostgreSQL(pgvector) 的索引参数,如 ef_construction 和 ef_search 调大时,通常会提高召回的准确性和全面性,这为 Qwen 模型提供了更相关、更丰富的上下文信息,但同时也会增加向量检索的计算开销。

容易做错的三处

  • 日志显示 PG::ConnectionBad: could not connect to server:PG_URL 中的主机、端口或凭证信息不正确,导致数据库连接失败。
  • 模型返回的回答中知识点不完整或缺失:ef_search 参数设置过低,导致向量检索召回率不足,未能提供足够的相关段落给模型。
  • 系统响应时间过长,尤其在知识库查询阶段:ef_construction 或 m 参数设置过大,导致 HNSW 索引构建或查询开销过高。

怎么确认配好了

  • 执行一次包含知识库的查询,检查 PostgreSQL 数据库的慢查询日志,确认向量检索操作的耗时是否在可接受范围内。
  • 通过 FastGPT 界面查看 RAG 流程中模型接收到的上下文长度,确认召回内容总 token 数未超过模型的引用上限。
  • 针对多个测试问题,验证模型回答中知识库内容的准确性和完整性,据此调整 ef_search 和召回条数,找到一个平衡点。
  • 监控 PostgreSQL 数据库的 CPU 和内存使用率,确保在高并发请求下数据库性能稳定。

参考资料