模型指南官方文档4 分钟阅读模型组合页

StepFun 256K 上下文 这一档模型配 PostgreSQL(pgvector) 的配置口径

StepFun 这一档模型,其上下文长度达到 256000 token,这决定了单次模型调用能够处理的输入信息总量。引用上限 240000 token,意味着模型在生成回复时,可以从召回内容中引用的 token 总量,这是一个预算值,并非限制了引用的段落数量。段落的实际数量由检索返回的条数和每段内容

这一档模型的参数意味着什么

StepFun 这一档模型,其上下文长度达到 256000 token,这决定了单次模型调用能够处理的输入信息总量。引用上限 240000 token,意味着模型在生成回复时,可以从召回内容中引用的 token 总量,这是一个预算值,并非限制了引用的段落数量。段落的实际数量由检索返回的条数和每段内容的长度共同决定。模型不支持图片输入,表示多模态能力不在此档位体现。工具调用能力的开启,则为模型提供了执行外部操作的可能性。

配 PostgreSQL(pgvector) 要定哪些

配置项建议取法这样取的依据
PG_URLpostgresql://user:password@host:port/database数据库连接标准格式,确保 FastGPT 能正确连接到 pgvector 实例。
ef_construction64HNSW 索引构建参数,影响索引质量与构建速度。较低的值构建快但查询可能慢,较高的值反之。
ef_search40HNSW 索引查询参数,影响查询召回率。值越大召回率越高但查询耗时越长。
m = 3232HNSW 索引的邻居数,影响索引结构和查询性能。该值是 pgvector 默认且推荐的平衡值。
vector_ip_opstruepgvector 索引操作符,启用内积相似度计算,适用于嵌入向量。

这两者互相约束的地方

模型 256000 token 的上下文长度与 pgvector 返回的召回条数存在直接关联。检索系统返回的每个段落长度与总条数之积,必须控制在模型的上下文长度预算之内。引用上限 240000 token 是一个 token 预算,而 pgvector 返回的是条目数量。当检索到的单段内容较长时,即使返回条数不多,也可能迅速触及引用上限;反之,若单段内容较短,则可以引用更多条目。索引参数 ef_construction 和 ef_search 的调整,会影响 pgvector 的查询速度和召回质量。更高的 ef_search 值可能带来更精准的召回结果,从而为模型提供更相关的上下文,但也可能增加查询延迟。模型在处理更精准但可能更长的输入时,会占用更多的上下文预算。

容易做错的三处

  • 模型返回 Context window exceeded 错误:召回内容的总 token 数超过了模型 256000 token 的上下文长度。
  • 检索结果的相似度评分异常或召回内容不相关:ef_search 参数设置过低,导致向量检索未能充分探索邻近向量空间。
  • FastGPT 启动时数据库连接失败:PG_URL 配置有误,例如用户名、密码或端口号不正确。

怎么确认配好了

  • 通过 FastGPT 后台的调试工具,观察模型请求的 prompt_tokens 和 completion_tokens,确认总输入 token 数在上下文长度范围内。
  • 在 pgvector 数据库中执行 EXPLAIN ANALYZE 针对向量查询的 SQL 语句,检查 HNSW 索引是否被有效利用,并观察查询耗时。
  • 在 FastGPT 中上传文档并进行知识库测试,检查召回结果的质量和相关性,并通过调整查询参数和索引参数来优化。

参考资料