这一档模型的参数意味着什么
此档模型具备 32000 的上下文长度,意味着单次请求中可处理的输入文本总量上限。引用上限同样为 32000,这直接决定了知识库召回内容可被模型参考的最大字数。图片输入能力 true 使得模型能够理解并处理图像信息,为多模态应用提供了基础。工具调用能力 false 则表明此档模型不直接支持函数调用或外部工具集成,处理复杂任务时需依赖外部逻辑编排。
配 PostgreSQL(pgvector) 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PG_URL | postgresql://user:password@host:port/database | 数据库连接字符串,确保可访问性和权限 |
ef_construction | 100–200 | 构建 HNSW 索引时的邻居搜索参数,影响索引质量和构建时间 |
ef_search | 60–100 | 查询 HNSW 索引时的邻居搜索参数,影响召回精度和查询速度 |
m | 32 | HNSW 索引的层数参数,影响内存占用和查询性能 |
vector_ip_ops | true | 启用内积距离计算,适用于某些嵌入模型输出 |
这两者互相约束的地方
模型的 32000 上下文长度是核心约束。知识库召回的文本总长度(召回条数乘以每段平均长度)必须严格控制在此上限之内,否则模型无法完整处理。引用上限 32000 与向量库返回条数共同决定了最终进入模型的知识量。如果向量库配置的 limit 参数返回了过多的条目,但总长度超出了引用上限,超出部分将被截断。索引参数 ef_construction 和 ef_search 的调大,通常会提升向量召回的准确性,这意味着模型接收到的上下文信息质量可能更高,但代价是索引构建和查询时间的增加。在有限的上下文窗口内,高质量的召回能更有效地利用模型处理能力。
容易做错的三处
- 日志显示
context window exceeded:知识库召回内容总长度超过了模型 32000 的上下文长度限制。 - 返回内容与预期不符,且知识库引用为空:向量检索未能返回相关结果,可能是
ef_search过低或索引质量问题。 - 查询响应时间过长:
ef_search设置过高导致向量检索耗时增加,或m参数设置不当影响索引效率。
怎么确认配好了
- 在知识库配置页面,调整单次召回条数和每段最大字符数,并观察模型响应中引用内容的完整性,确保总长度不超过 32000 的引用上限。
- 使用
EXPLAIN ANALYZE命令分析 pgvector 查询语句的执行计划,检查 HNSW 索引是否被有效利用,并评估查询耗时是否在可接受范围内。 - 在 FastGPT 内部的调试模式下,针对特定问题,观察召回的知识片段是否与问题高度相关,并检查
vector_ip_ops是否正确生效。