模型指南官方文档4 分钟阅读模型组合页

StepFun 32K 上下文 这一档模型配 PostgreSQL(pgvector) 的配置口径

`step-1o-turbo-vision` 模型属于 StepFun 32K 上下文档位,其 `maxContext` 参数为 32000 token,这直接决定了单次请求中模型能处理的输入信息总量。`quoteMaxToken` 为 32000 token,这意味着用于引用的检索内容总计可以消耗

这一档模型的参数意味着什么

step-1o-turbo-vision 模型属于 StepFun 32K 上下文档位,其 maxContext 参数为 32000 token,这直接决定了单次请求中模型能处理的输入信息总量。quoteMaxToken 为 32000 token,这意味着用于引用的检索内容总计可以消耗的 token 预算上限。检索系统返回的段落条数与 quoteMaxToken 是两个独立变量,引用内容的实际 token 消耗受其文本长度影响。模型支持图片输入,允许在对话中融入视觉信息进行多模态理解。工具调用能力的提供,则允许模型在复杂任务场景下,通过外部工具的执行来完成特定操作或获取信息。

配 PostgreSQL(pgvector) 要定哪些

配置项建议取法这样取的依据
PG_URLpostgresql://user:password@host:port/database数据库连接标准格式,确保 FastGPT 能正确连接。
ef_construction64影响索引构建时的图连接数,越大召回质量越高但构建耗时增加。
ef_search32影响查询时的图遍历节点数,越大搜索精度越高但查询耗时增加。
m32HNSW 索引中每层图的最大邻居数,影响索引结构和查询性能。
vector_ip_opstrue启用内积距离计算,适用于某些嵌入模型输出的向量距离度量。
召回条数8经验值,平衡引用内容与模型上下文长度。

这两者互相约束的地方

检索系统返回的文档条数与每段文档的长度共同决定了引用内容的总体 token 消耗。这个消耗必须服从模型 maxContext 的预算限制,同时 quoteMaxToken 设定了引用内容本身的 token 上限。当每段文档较短时,系统可以返回更多条文档,而当每段文档较长时,即使返回较少条文档也可能触及 quoteMaxToken 的限制。索引参数 ef_construction 和 ef_search 的增大,会提高向量检索的召回精度,这意味着模型能获得更高质量的引用内容。然而,这也可能增加 PostgreSQL(pgvector)的索引构建和查询延迟,需要在实际部署中进行性能权衡。

容易做错的三处

  • 系统日志显示 Context window exceeded 错误:原因在于检索到的内容加上用户输入超过了 maxContext 限制。
  • 模型回答中引用的内容不完整或缺失:原因是 quoteMaxToken 预算不足,导致部分检索内容被截断。
  • 检索结果返回缓慢,响应时间超出预期:原因是 ef_search 设置过高,导致向量搜索计算量过大。

怎么确认配好了

  • 在 FastGPT 界面中,通过调试模式观察每次请求的 input_tokens 和 quote_tokens 计数,确保其符合预期。
  • 使用 FastGPT 的知识库测试功能,上传不同长度的文档,观察检索结果的召回条数与引用内容是否完整。
  • 在 PostgreSQL 数据库中,通过 EXPLAIN ANALYZE 命令分析 pgvector 查询语句的执行计划,检查索引是否被有效利用。
  • 监控 PostgreSQL 数据库的 CPU 和内存使用率,确保在负载高峰期性能稳定。

参考资料