这一档模型的参数意味着什么
grok-build-0.1 模型上下文长度达 256000 token,支持在单次请求中处理大量输入信息。其引用上限为 200000 token,这限定了作为引用内容提供给模型的总 token 预算。引用内容的总 token 量是关键的限制。工具调用能力允许模型与外部系统交互以获取信息或执行操作。图片输入功能则使模型能够处理视觉信息,支持多模态RAG应用场景。
配 PostgreSQL(pgvector) 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PG_URL | postgresql://user:password@host:port/database | FastGPT 连接 pgvector 数据库的标准格式 |
ef_construction | 64–128 | 影响 HNSW 索引构建质量和查询召回率,更高值通常带来更优召回但构建时间增加 |
ef_search | 64–128 | 影响 HNSW 索引查询召回率,更高值通常带来更优召回但查询延迟增加 |
m = 32 | 32 | HNSW 索引的图层最大连接数,影响索引结构和查询效率 |
| 召回条数 | 5–10 条 | 根据模型引用上限和单段平均 token 数估算,避免超出引用预算 |
| 向量维度 | 1536 | 与嵌入模型输出维度保持一致,确保向量匹配正确性 |
这两者互相约束的地方
召回条数与每段内容的长度共同决定了总的引用 token 消耗。模型 256000 token 的上下文预算是总量的上限。引用上限 200000 token 限制了可以作为参考材料提供给模型的 token 总量,而向量库返回的是固定数量的段落。当每段内容较短时,模型可以处理更多的段落;当每段内容较长时,即使段落数量不多也可能迅速触及引用上限。索引参数如 ef_construction 和 ef_search 的调高,可以提升向量检索的召回率和准确性,这意味着向量库能更大概率地返回与查询高度相关的段落。这些高质量的段落将更有效地利用模型的引用预算,从而提升模型生成回答的质量。
容易做错的三处
- 日志显示
context_exceeded错误:原因在于召回内容的总 token 数加上用户输入超出了模型的 256000 token 上限。 - 模型回答内容简短且信息不足:原因可能是检索到的段落总 token 数接近或超过 200000 的引用上限,导致模型可用引用信息受限。
- 检索结果与用户意图偏差较大:原因可能为
ef_search参数设置过低,导致 pgvector 检索时未能充分探索 HNSW 图,错失了更相关的向量。
怎么确认配好了
- 执行一系列复杂查询,观察模型回答内容是否充分引用了召回信息,并检查日志中是否存在
context_exceeded或quote_limit_reached相关警告。 - 通过 pgvector 提供的
pg_stat_statements视图,分析向量查询的平均响应时间,并与业务可接受的延迟阈值进行比较。 - 对比不同
ef_search参数配置下的召回准确率,并根据实际业务场景需求确定合适的阈值。 - 通过 FastGPT 界面检查知识库召回的段落数量和内容,确保其与预期一致,并验证单次召回的 token 总量是否在 200000 token 引用上限内。