这一档模型的参数意味着什么
StepFun 这一档模型,其上下文长度达到 256000 token,这决定了单次模型调用能够处理的输入信息总量。引用上限 240000 token,意味着模型在生成回复时,可以从召回内容中引用的 token 总量,这是一个预算值,并非限制了引用的段落数量。段落的实际数量由检索返回的条数和每段内容的长度共同决定。模型不支持图片输入,表示多模态能力不在此档位体现。工具调用能力的开启,则为模型提供了执行外部操作的可能性。
配 PostgreSQL(pgvector) 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PG_URL | postgresql://user:password@host:port/database | 数据库连接标准格式,确保 FastGPT 能正确连接到 pgvector 实例。 |
ef_construction | 64 | HNSW 索引构建参数,影响索引质量与构建速度。较低的值构建快但查询可能慢,较高的值反之。 |
ef_search | 40 | HNSW 索引查询参数,影响查询召回率。值越大召回率越高但查询耗时越长。 |
m = 32 | 32 | HNSW 索引的邻居数,影响索引结构和查询性能。该值是 pgvector 默认且推荐的平衡值。 |
vector_ip_ops | true | pgvector 索引操作符,启用内积相似度计算,适用于嵌入向量。 |
这两者互相约束的地方
模型 256000 token 的上下文长度与 pgvector 返回的召回条数存在直接关联。检索系统返回的每个段落长度与总条数之积,必须控制在模型的上下文长度预算之内。引用上限 240000 token 是一个 token 预算,而 pgvector 返回的是条目数量。当检索到的单段内容较长时,即使返回条数不多,也可能迅速触及引用上限;反之,若单段内容较短,则可以引用更多条目。索引参数 ef_construction 和 ef_search 的调整,会影响 pgvector 的查询速度和召回质量。更高的 ef_search 值可能带来更精准的召回结果,从而为模型提供更相关的上下文,但也可能增加查询延迟。模型在处理更精准但可能更长的输入时,会占用更多的上下文预算。
容易做错的三处
- 模型返回
Context window exceeded错误:召回内容的总 token 数超过了模型 256000 token 的上下文长度。 - 检索结果的相似度评分异常或召回内容不相关:
ef_search参数设置过低,导致向量检索未能充分探索邻近向量空间。 - FastGPT 启动时数据库连接失败:
PG_URL配置有误,例如用户名、密码或端口号不正确。
怎么确认配好了
- 通过 FastGPT 后台的调试工具,观察模型请求的
prompt_tokens和completion_tokens,确认总输入 token 数在上下文长度范围内。 - 在 pgvector 数据库中执行
EXPLAIN ANALYZE针对向量查询的 SQL 语句,检查 HNSW 索引是否被有效利用,并观察查询耗时。 - 在 FastGPT 中上传文档并进行知识库测试,检查召回结果的质量和相关性,并通过调整查询参数和索引参数来优化。