模型指南官方文档4 分钟阅读模型组合页

Grok 256K 上下文 这一档模型配 PostgreSQL(pgvector) 的配置口径

`grok-build-0.1` 模型上下文长度达 256000 token,支持在单次请求中处理大量输入信息。其引用上限为 200000 token,这限定了作为引用内容提供给模型的总 token 预算。引用内容的总 token 量是关键的限制。工具调用能力允许模型与外部系统交互以获取信息或执行操

这一档模型的参数意味着什么

grok-build-0.1 模型上下文长度达 256000 token,支持在单次请求中处理大量输入信息。其引用上限为 200000 token,这限定了作为引用内容提供给模型的总 token 预算。引用内容的总 token 量是关键的限制。工具调用能力允许模型与外部系统交互以获取信息或执行操作。图片输入功能则使模型能够处理视觉信息,支持多模态RAG应用场景。

配 PostgreSQL(pgvector) 要定哪些

配置项建议取法这样取的依据
PG_URLpostgresql://user:password@host:port/databaseFastGPT 连接 pgvector 数据库的标准格式
ef_construction64–128影响 HNSW 索引构建质量和查询召回率,更高值通常带来更优召回但构建时间增加
ef_search64–128影响 HNSW 索引查询召回率,更高值通常带来更优召回但查询延迟增加
m = 3232HNSW 索引的图层最大连接数,影响索引结构和查询效率
召回条数5–10 条根据模型引用上限和单段平均 token 数估算,避免超出引用预算
向量维度1536与嵌入模型输出维度保持一致,确保向量匹配正确性

这两者互相约束的地方

召回条数与每段内容的长度共同决定了总的引用 token 消耗。模型 256000 token 的上下文预算是总量的上限。引用上限 200000 token 限制了可以作为参考材料提供给模型的 token 总量,而向量库返回的是固定数量的段落。当每段内容较短时,模型可以处理更多的段落;当每段内容较长时,即使段落数量不多也可能迅速触及引用上限。索引参数如 ef_construction 和 ef_search 的调高,可以提升向量检索的召回率和准确性,这意味着向量库能更大概率地返回与查询高度相关的段落。这些高质量的段落将更有效地利用模型的引用预算,从而提升模型生成回答的质量。

容易做错的三处

  • 日志显示 context_exceeded 错误:原因在于召回内容的总 token 数加上用户输入超出了模型的 256000 token 上限。
  • 模型回答内容简短且信息不足:原因可能是检索到的段落总 token 数接近或超过 200000 的引用上限,导致模型可用引用信息受限。
  • 检索结果与用户意图偏差较大:原因可能为 ef_search 参数设置过低,导致 pgvector 检索时未能充分探索 HNSW 图,错失了更相关的向量。

怎么确认配好了

  • 执行一系列复杂查询,观察模型回答内容是否充分引用了召回信息,并检查日志中是否存在 context_exceeded 或 quote_limit_reached 相关警告。
  • 通过 pgvector 提供的 pg_stat_statements 视图,分析向量查询的平均响应时间,并与业务可接受的延迟阈值进行比较。
  • 对比不同 ef_search 参数配置下的召回准确率,并根据实际业务场景需求确定合适的阈值。
  • 通过 FastGPT 界面检查知识库召回的段落数量和内容,确保其与预期一致,并验证单次召回的 token 总量是否在 200000 token 引用上限内。

参考资料