模型指南官方文档4 分钟阅读模型组合页

Qwen 260K 上下文 这一档模型配 PostgreSQL(pgvector) 的配置口径

Qwen 260K 上下文模型提供了 260000 的上下文长度,这决定了单次模型调用能处理的总输入信息量。引用上限 260000 token 意味着模型在生成回答时,用于引用外部知识的预算上限。引用内容的总 token 数量受此限制。模型支持工具调用,可以在生成过程中调用外部工具获取信息或执行操作

这一档模型的参数意味着什么

Qwen 260K 上下文模型提供了 260000 的上下文长度,这决定了单次模型调用能处理的总输入信息量。引用上限 260000 token 意味着模型在生成回答时,用于引用外部知识的预算上限。引用内容的总 token 数量受此限制。模型支持工具调用,可以在生成过程中调用外部工具获取信息或执行操作。该模型不具备图片输入能力。

配 PostgreSQL(pgvector) 要定哪些

配置项建议取法这样取的依据
PG_URLpostgresql://user:password@host:port/database数据库连接字符串,确保模型服务能访问 pgvector
ef_construction80–120影响 HNSW 索引构建时的图连接数,越大召回质量越高但构建慢
ef_search60–100影响 HNSW 索引查询时的邻居搜索范围,越大召回质量越高但查询慢
m = 3232HNSW 索引的图层数,影响索引大小和查询效率
vector_ip_opstrue启用向量内积操作,用于计算相似度
max_connections按实测标定数据库最大并发连接数,需根据服务并发量调整

这两者互相约束的地方

模型上下文预算与向量库返回的召回条数及每段长度直接相关。召回条数乘以每段的平均 token 数量,不应超过模型的上下文长度 260000 token。引用上限 260000 token 限制了模型实际能使用的引用内容总量。向量库返回的是固定条数的段落,而模型处理的是这些段落的 token 总和。当单段平均 token 数较高时,引用上限可能在条数较少时就已触及。反之,若单段 token 数较少,则可以引用更多条段落。PostgreSQL(pgvector)的索引参数 ef_construction 和 ef_search 调大后,向量检索的召回质量会提高,意味着返回的段落与查询更相关,这有助于模型在给定的引用上限内获得更精准的信息。

容易做错的三处

  • 模型返回 Context window exceeded 错误,原因是向量库返回的段落总 token 数超出了模型上下文限制。
  • 查询结果相关性差,用户反馈回答不准确,原因是 ef_search 参数设置过低导致检索范围不足。
  • 数据库连接超时或拒绝连接,原因是 PG_URL 配置错误或数据库 max_connections 不足。

怎么确认配好了

  • 执行一次包含大量召回内容的查询,检查模型是否能成功返回结果且不报错,并观察引用内容的 token 计数是否在引用上限内。
  • 在 FastGPT 界面进行几次检索测试,对比不同 ef_search 和 ef_construction 参数下的召回段落与查询的相关性,找到平衡点。
  • 通过数据库监控工具观察 PostgreSQL 的连接数和查询延迟,确保在高并发下数据库性能稳定,没有连接耗尽或慢查询。

参考资料