模型指南官方文档4 分钟阅读模型组合页

Siliconflow 32K 上下文 这一档模型配 PostgreSQL(pgvector) 的配置口径

此档模型具备 32000 的上下文长度,意味着单次请求中可处理的输入文本总量上限。引用上限同样为 32000,这直接决定了知识库召回内容可被模型参考的最大字数。图片输入能力 `true` 使得模型能够理解并处理图像信息,为多模态应用提供了基础。工具调用能力 `false` 则表明此档模型不直接支持函

这一档模型的参数意味着什么

此档模型具备 32000 的上下文长度,意味着单次请求中可处理的输入文本总量上限。引用上限同样为 32000,这直接决定了知识库召回内容可被模型参考的最大字数。图片输入能力 true 使得模型能够理解并处理图像信息,为多模态应用提供了基础。工具调用能力 false 则表明此档模型不直接支持函数调用或外部工具集成,处理复杂任务时需依赖外部逻辑编排。

配 PostgreSQL(pgvector) 要定哪些

配置项建议取法这样取的依据
PG_URLpostgresql://user:password@host:port/database数据库连接字符串,确保可访问性和权限
ef_construction100–200构建 HNSW 索引时的邻居搜索参数,影响索引质量和构建时间
ef_search60–100查询 HNSW 索引时的邻居搜索参数,影响召回精度和查询速度
m32HNSW 索引的层数参数,影响内存占用和查询性能
vector_ip_opstrue启用内积距离计算,适用于某些嵌入模型输出

这两者互相约束的地方

模型的 32000 上下文长度是核心约束。知识库召回的文本总长度(召回条数乘以每段平均长度)必须严格控制在此上限之内,否则模型无法完整处理。引用上限 32000 与向量库返回条数共同决定了最终进入模型的知识量。如果向量库配置的 limit 参数返回了过多的条目,但总长度超出了引用上限,超出部分将被截断。索引参数 ef_construction 和 ef_search 的调大,通常会提升向量召回的准确性,这意味着模型接收到的上下文信息质量可能更高,但代价是索引构建和查询时间的增加。在有限的上下文窗口内,高质量的召回能更有效地利用模型处理能力。

容易做错的三处

  • 日志显示 context window exceeded:知识库召回内容总长度超过了模型 32000 的上下文长度限制。
  • 返回内容与预期不符,且知识库引用为空:向量检索未能返回相关结果,可能是 ef_search 过低或索引质量问题。
  • 查询响应时间过长:ef_search 设置过高导致向量检索耗时增加,或 m 参数设置不当影响索引效率。

怎么确认配好了

  • 在知识库配置页面,调整单次召回条数和每段最大字符数,并观察模型响应中引用内容的完整性,确保总长度不超过 32000 的引用上限。
  • 使用 EXPLAIN ANALYZE 命令分析 pgvector 查询语句的执行计划,检查 HNSW 索引是否被有效利用,并评估查询耗时是否在可接受范围内。
  • 在 FastGPT 内部的调试模式下,针对特定问题,观察召回的知识片段是否与问题高度相关,并检查 vector_ip_ops 是否正确生效。

参考资料