这一档模型的参数意味着什么
这一档模型,包含 Baichuan4、Baichuan4-Turbo、Baichuan4-Air、Baichuan3-Turbo。其上下文长度为 32000 token,决定了单次交互中模型可处理的总信息量,包括用户输入、历史对话以及召回内容。引用上限为 30000 token,这是为召回内容预留的 token 预算。引用预算限制了所有召回内容合计占用的 token 数量,而召回条数由向量库的检索结果决定。工具调用能力表明模型可以与外部系统交互,执行特定任务。图片输入功能为 false,意味着当前模型不支持直接处理图像信息。
配 PostgreSQL(pgvector) 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PG_URL | postgresql://user:password@host:port/database | 数据库连接标准格式,确保可访问性 |
ef_construction | 64 | HNSW 索引构建参数,影响索引质量与构建时间 |
ef_search | 32 | HNSW 索引查询参数,影响查询性能与召回精度 |
m = 32 | 32 | HNSW 索引参数,控制每个节点的最大连接数 |
vector_ip_ops | true | 启用向量内积操作,与模型的 embedding 兼容 |
| 召回条数 | 前 5 条 | 平衡召回广度与引用上限,降低 token 消耗 |
这两者互相约束的地方
模型上下文长度为 32000 token,召回内容总 token 量与每段召回内容的长度以及召回条数直接相关。引用上限 30000 token 限制了所有召回内容合计的 token 预算,而 PostgreSQL(pgvector)返回的是离散的条目。当单段召回内容较长时,即使召回条数不多,也可能迅速触及引用上限。反之,如果每段内容短小,可以召回更多条目。向量库的索引参数,例如 ef_construction 和 ef_search,调大后可以提升召回精度,为模型提供更相关的上下文,从而在有限的引用上限内提供更高质量的信息。
容易做错的三处
- 日志显示
context window exceeded:召回内容总 token 加上用户输入和历史对话超出了模型的上下文长度限制。 - 检索结果返回为空或不相关:
ef_search或ef_construction参数设置过低,导致向量索引的召回精度不足。 - 模型输出内容与期望不符:引用上限内的召回内容并非最相关,或者每段内容过长导致有效信息被截断。
怎么确认配好了
- 针对特定查询,检查 PostgreSQL(pgvector) 返回的向量相似度分数,确认召回条目的相关性是否达到预期阈值。
- 使用 FastGPT 的调试功能,观察模型实际接收到的召回内容 token 数量,确保其在引用上限内。
- 模拟高并发场景,监控 PostgreSQL(pgvector) 的查询响应时间,确保
ef_search参数下的性能满足业务需求。