模型指南官方文档4 分钟阅读模型组合页

SparkDesk 8K 上下文 这一档模型配 PostgreSQL(pgvector) 的配置口径

SparkDesk 8K 上下文模型系列,其上下文长度 `maxContext` 达 8000 token,决定了单次交互中模型可处理的输入和输出总量。引用上限 `quoteMaxToken` 同样为 8000 token,此参数限定了所有引用内容在输入给模型时所占用的 token 总预算。段落的召

这一档模型的参数意味着什么

SparkDesk 8K 上下文模型系列,其上下文长度 maxContext 达 8000 token,决定了单次交互中模型可处理的输入和输出总量。引用上限 quoteMaxToken 同样为 8000 token,此参数限定了所有引用内容在输入给模型时所占用的 token 总预算。段落的召回数量由检索系统决定,与引用内容的 token 预算是不同的衡量维度。单次最大输出 maxTokens 未标注,意味着实际输出长度需通过实践确定。此档模型不支持图片输入与工具调用,因此不适用于需要多模态输入或复杂外部工具集成的场景。

配 PostgreSQL(pgvector) 要定哪些

配置项建议取法这样取的依据
PG_URLpostgresql://user:password@host:port/database数据库连接的标准化 URI 格式,确保 FastGPT 能正确连接到 PostgreSQL 实例。
ef_construction80控制 HNSW 索引构建时的邻居搜索宽度,影响索引质量与构建时间。
ef_search60控制 HNSW 索引查询时的邻居搜索宽度,影响查询精度与速度。
m32HNSW 索引中每个节点的最大连接数,影响索引大小和查询性能。
vector_ip_opstrue启用内积距离计算,适用于某些嵌入模型输出的向量。
search_limit按实测标定向量搜索返回的原始条数,需根据实际召回效果与模型引用上限综合调整。

这两者互相约束的地方

SparkDesk 8K 上下文模型与 PostgreSQL(pgvector) 的集成,需要注意召回内容与模型上下文的匹配。召回条数与每段文本的长度共同决定了输入模型的内容总量,此总量不能超出模型 maxContext 的 8000 token 限制。引用上限 quoteMaxToken 设定了所有引用内容合计的 token 预算,而向量库返回的是固定数量的段落条数。两者之间,谁先达到限制取决于每段文本的平均长度。当 PostgreSQL(pgvector) 的 ef_construction 或 m 等索引参数调大时,索引质量和召回精度通常会提升,这将为模型提供更相关的上下文,从而可能在引用上限允许范围内提供更准确的回答。如果向量库返回的段落过长,即使召回条数不多,也可能迅速触及模型的引用上限。

容易做错的三处

  • 模型返回 Context window exceeded 错误码,原因在于召回的文档内容总 token 量超出了模型的 maxContext。
  • 搜索结果的 relevance 字段长时间为空,原因是 ef_search 参数设置过低,导致向量搜索精度不足。
  • 查询响应时间显著变长,原因是 ef_construction 和 m 参数设置过大,导致 HNSW 索引构建或查询开销过高。

怎么确认配好了

  • 通过 FastGPT 调试界面观察每次请求的 context_length,确保其在模型 maxContext 限制内。
  • 在 PostgreSQL 数据库中执行 EXPLAIN ANALYZE 命令,检查 pgvector 索引是否被有效使用,并评估查询耗时。
  • 使用 FastGPT 的知识库测试功能,调整不同的 search_limit 值,观察召回内容的数量和相关性,并与模型的 quoteMaxToken 进行比对。

参考资料