模型指南官方文档4 分钟阅读模型组合页

ChatGLM 8K 上下文 这一档模型配 PostgreSQL(pgvector) 的配置口径

`glm-4v-flash` 模型上下文长度达 8000 Token,这意味着单次对话中模型能够处理的输入与输出总和上限为 8000 Token。引用上限 6000 Token,限定了用于构建回答的引用内容总计不能超过此预算。段落条数由检索系统返回的数量决定,引用内容的 Token 预算与返回的段落

这一档模型的参数意味着什么

glm-4v-flash 模型上下文长度达 8000 Token,这意味着单次对话中模型能够处理的输入与输出总和上限为 8000 Token。引用上限 6000 Token,限定了用于构建回答的引用内容总计不能超过此预算。段落条数由检索系统返回的数量决定,引用内容的 Token 预算与返回的段落条数是两个独立的衡量标准。模型支持图片输入,允许在对话中融入视觉信息进行多模态理解。此档模型不直接支持工具调用。

配 PostgreSQL(pgvector) 要定哪些

配置项建议取法这样取的依据
PG_URLpostgresql://user:password@host:port/databaseFastGPT 连接数据库的标准形式
ef_construction64影响 HNSW 索引构建时的图层连接数,数值越大召回率越高但构建时间增加
ef_search32影响 HNSW 索引查询时的邻居搜索数,数值越大召回率越高但查询延迟增加
m = 3232HNSW 索引的每层最大连接数,影响索引大小与查询效率的平衡
vector_ip_opstruepgvector 向量计算操作符,确保使用内积距离计算
max_connections100数据库最大并发连接数,需根据 FastGPT 实例数和并发请求量调整

这两者互相约束的地方

模型上下文长度与向量库召回内容之间存在直接的预算关系。召回的段落条数乘以每段平均长度,其总和必须控制在 8000 Token 上下文长度以内,以确保模型能够完整处理所有输入。引用上限按 Token 计,而向量库返回的是独立的段落条数。当每段内容较短时,可能会先达到模型处理的段落条数限制,再触及引用上限;当每段内容较长时,则可能先触及引用上限,即使返回的段落条数不多。PostgreSQL(pgvector)的索引参数,如 ef_construction 和 ef_search,调大后可以提高向量检索的召回率,这意味着向量库能够更准确地找到与查询相关的内容。高召回率有助于为 glm-4v-flash 模型提供更优质的引用素材,使其在 6000 Token 的引用预算内构建出更准确、更丰富的回答。

容易做错的三处

  • 日志显示「PostgreSQL connection refused」,原因可能是 PG_URL 中的主机或端口配置不正确。
  • FastGPT 界面返回的回答缺乏相关性,原因可能是 ef_search 参数设置过低,导致向量检索未能找到足够多的相关段落。
  • 插入向量数据时出现「value too long for type vector(1536)」错误,原因可能是向量维度与 pgvector 表字段定义不符。

怎么确认配好了

  • 执行一次完整的 RAG 流程,检查 FastGPT 返回的回答是否包含从知识库召回的内容,并通过日志确认数据库查询成功。
  • 在 PostgreSQL 数据库中执行 SELECT * FROM pg_stat_activity WHERE datname = 'your_database_name'; 命令,确认连接数符合预期,没有大量空闲连接。
  • 使用 EXPLAIN ANALYZE 命令分析 pgvector 索引查询的性能,确保查询时间在可接受范围内。
  • 定期检查 FastGPT 日志输出,确认没有数据库相关的错误信息或警告。

参考资料