模型指南官方文档4 分钟阅读模型组合页

Baichuan 32K 上下文 这一档模型配 PostgreSQL(pgvector) 的配置口径

这一档模型,包含 `Baichuan4`、`Baichuan4-Turbo`、`Baichuan4-Air`、`Baichuan3-Turbo`。其上下文长度为 32000 token,决定了单次交互中模型可处理的总信息量,包括用户输入、历史对话以及召回内容。引用上限为 30000 token,这是

这一档模型的参数意味着什么

这一档模型,包含 Baichuan4、Baichuan4-Turbo、Baichuan4-Air、Baichuan3-Turbo。其上下文长度为 32000 token,决定了单次交互中模型可处理的总信息量,包括用户输入、历史对话以及召回内容。引用上限为 30000 token,这是为召回内容预留的 token 预算。引用预算限制了所有召回内容合计占用的 token 数量,而召回条数由向量库的检索结果决定。工具调用能力表明模型可以与外部系统交互,执行特定任务。图片输入功能为 false,意味着当前模型不支持直接处理图像信息。

配 PostgreSQL(pgvector) 要定哪些

配置项建议取法这样取的依据
PG_URLpostgresql://user:password@host:port/database数据库连接标准格式,确保可访问性
ef_construction64HNSW 索引构建参数,影响索引质量与构建时间
ef_search32HNSW 索引查询参数,影响查询性能与召回精度
m = 3232HNSW 索引参数,控制每个节点的最大连接数
vector_ip_opstrue启用向量内积操作,与模型的 embedding 兼容
召回条数前 5 条平衡召回广度与引用上限,降低 token 消耗

这两者互相约束的地方

模型上下文长度为 32000 token,召回内容总 token 量与每段召回内容的长度以及召回条数直接相关。引用上限 30000 token 限制了所有召回内容合计的 token 预算,而 PostgreSQL(pgvector)返回的是离散的条目。当单段召回内容较长时,即使召回条数不多,也可能迅速触及引用上限。反之,如果每段内容短小,可以召回更多条目。向量库的索引参数,例如 ef_construction 和 ef_search,调大后可以提升召回精度,为模型提供更相关的上下文,从而在有限的引用上限内提供更高质量的信息。

容易做错的三处

  • 日志显示 context window exceeded:召回内容总 token 加上用户输入和历史对话超出了模型的上下文长度限制。
  • 检索结果返回为空或不相关:ef_search 或 ef_construction 参数设置过低,导致向量索引的召回精度不足。
  • 模型输出内容与期望不符:引用上限内的召回内容并非最相关,或者每段内容过长导致有效信息被截断。

怎么确认配好了

  • 针对特定查询,检查 PostgreSQL(pgvector) 返回的向量相似度分数,确认召回条目的相关性是否达到预期阈值。
  • 使用 FastGPT 的调试功能,观察模型实际接收到的召回内容 token 数量,确保其在引用上限内。
  • 模拟高并发场景,监控 PostgreSQL(pgvector) 的查询响应时间,确保 ef_search 参数下的性能满足业务需求。

参考资料