这一档模型的参数意味着什么
Qwen 256K 上下文模型提供了宽裕的输入空间。上下文长度 256000 tokens 决定了单次请求中可以承载的指令、历史对话和召回内容的总体规模。引用上限 256000 tokens 则明确了用于承载知识库召回内容的预算。在 RAG 场景下,实际召回的段落总 token 数必须控制在此上限之内。单次最大输出未标注意味着模型在生成回复时没有硬性长度限制,但实际输出长度仍受限于整体上下文长度。工具调用能力的开启,允许模型在需要时执行外部函数或 API,扩展了其处理复杂任务的边界。图片输入为 false,表示此档模型不支持直接处理图像信息。
配 PostgreSQL(pgvector) 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PG_URL | postgresql://user:password@host:port/database | 数据库连接字符串,确保网络可达性与凭证正确 |
ef_construction | 64 到 128 | 影响 HNSW 索引构建质量,过小召回率低,过大索引构建慢 |
ef_search | 32 到 64 | 影响 HNSW 搜索时的召回精度,通常大于或等于 ef_construction |
m | 32 | HNSW 图结构中每个节点的最大连接数,影响索引大小和查询性能 |
vector_ip_ops | true | 使用内积操作符加速向量相似度计算 |
max_connections | 按实测标定 | 数据库最大连接数,需根据并发请求量和数据库资源调整 |
这两者互相约束的地方
Qwen 256K 上下文模型的上下文长度和引用上限,与 PostgreSQL(pgvector) 的检索结果直接关联。向量库返回的段落数量乘以每段内容的平均 token 数,其总和必须低于模型的上下文长度,以确保所有信息都能被模型处理。特别地,引用上限 256000 tokens 是对召回内容总量的预算,它独立于向量库返回的条数。这意味着,如果每段内容较短,可以返回更多条;如果每段内容较长,则返回的条数会相应减少,以避免超出引用上限。当 PostgreSQL(pgvector) 的索引参数,如 ef_construction 和 ef_search 调大时,通常会提高召回的准确性和全面性,这为 Qwen 模型提供了更相关、更丰富的上下文信息,但同时也会增加向量检索的计算开销。
容易做错的三处
- 日志显示
PG::ConnectionBad: could not connect to server:PG_URL中的主机、端口或凭证信息不正确,导致数据库连接失败。 - 模型返回的回答中知识点不完整或缺失:
ef_search参数设置过低,导致向量检索召回率不足,未能提供足够的相关段落给模型。 - 系统响应时间过长,尤其在知识库查询阶段:
ef_construction或m参数设置过大,导致 HNSW 索引构建或查询开销过高。
怎么确认配好了
- 执行一次包含知识库的查询,检查 PostgreSQL 数据库的慢查询日志,确认向量检索操作的耗时是否在可接受范围内。
- 通过 FastGPT 界面查看 RAG 流程中模型接收到的上下文长度,确认召回内容总 token 数未超过模型的引用上限。
- 针对多个测试问题,验证模型回答中知识库内容的准确性和完整性,据此调整
ef_search和召回条数,找到一个平衡点。 - 监控 PostgreSQL 数据库的 CPU 和内存使用率,确保在高并发请求下数据库性能稳定。