模型指南官方文档4 分钟阅读模型组合页

ChatGLM 1000K 上下文 这一档模型配 PostgreSQL(pgvector) 的配置口径

`glm-5.3-flash` 模型具备 1000000 的上下文长度,这决定了单次模型调用能处理的总输入量,包括系统指令、用户查询和召回内容。引用上限 900000 意味着在 RAG 场景下,模型可接受的知识库引用段落总字数上限。图片输入能力支持处理图像数据,拓展了多模态应用场景。工具调用能力允许

这一档模型的参数意味着什么

glm-5.3-flash 模型具备 1000000 的上下文长度,这决定了单次模型调用能处理的总输入量,包括系统指令、用户查询和召回内容。引用上限 900000 意味着在 RAG 场景下,模型可接受的知识库引用段落总字数上限。图片输入能力支持处理图像数据,拓展了多模态应用场景。工具调用能力允许模型与外部系统交互,实现复杂任务自动化。这些参数共同构成了模型在工程实践中的能力边界和资源消耗。

配 PostgreSQL(pgvector) 要定哪些

配置项建议取法这样取的依据
PG_URLpostgresql://user:password@host:port/databaseFastGPT 连接 PostgreSQL 数据库的必要凭证,确保数据库可访问
ef_construction64影响 HNSW 索引构建时的邻居数量,平衡索引质量与构建时间,通常取 m * 2
ef_search40影响 HNSW 索引查询时的邻居数量,平衡搜索精度与查询速度,通常取 ef_construction 的 0.6 到 1.2 倍
m = 3232HNSW 索引层中每个节点的最大出边数量,影响索引大小和查询性能,32 是常见且高效的取值
vector_ip_opstrue启用向量内积操作的优化,符合大多数嵌入模型采用余弦相似度(通过归一化转为内积)的场景
召回条数前 10-20 条结合模型引用上限和单段长度,避免超出模型上下文窗口

这两者互相约束的地方

glm-5.3-flash 模型 1000000 的上下文长度与 900000 的引用上限,对 PostgreSQL(pgvector) 的召回策略构成直接约束。召回条数与每段知识库内容的长度乘积,必须严格控制在 900000 字以内,以确保所有引用内容都能被模型有效处理。若 pgvector 返回的条数过多,超出了引用上限,FastGPT 会自动截断或合并,导致部分召回信息丢失。在 pgvector 中,ef_search 和 ef_construction 等索引参数调大,可以提高召回精度,减少误召回,从而为模型提供更相关的信息。这意味着模型在有限的引用上限内能获得更高质量的输入,但同时会增加向量检索的计算开销。

容易做错的三处

  • 日志显示「Token limit exceeded」:原因在于召回的知识段落总长度加上用户查询和系统指令,超出了模型的 1000000 上下文长度。
  • 界面中 RAG 引用部分为空:原因可能是在 FastGPT 配置中设定的召回条数过少,或者 pgvector 索引的 ef_search 参数过低导致召回结果不相关。
  • 查询响应时间明显变长:原因可能是 pgvector 的 ef_search 参数设置过高,导致向量检索耗时增加,影响整体响应速度。

怎么确认配好了

  • 执行 FastGPT 的 RAG 问答流程,检查返回的引用段落数量与预期是否一致,并核对引用内容的相关性。
  • 在 PostgreSQL 数据库中,通过 EXPLAIN ANALYZE 命令分析 pgvector 查询的执行计划,确保索引被有效利用,并观察查询耗时。
  • 模拟不同长度的用户查询和知识库规模,持续监控 FastGPT 与 pgvector 的资源占用(CPU、内存)和响应时间,确定性能阈值。

参考资料