这一档模型的参数意味着什么
glm-4v-flash 模型上下文长度达 8000 Token,这意味着单次对话中模型能够处理的输入与输出总和上限为 8000 Token。引用上限 6000 Token,限定了用于构建回答的引用内容总计不能超过此预算。段落条数由检索系统返回的数量决定,引用内容的 Token 预算与返回的段落条数是两个独立的衡量标准。模型支持图片输入,允许在对话中融入视觉信息进行多模态理解。此档模型不直接支持工具调用。
配 PostgreSQL(pgvector) 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PG_URL | postgresql://user:password@host:port/database | FastGPT 连接数据库的标准形式 |
ef_construction | 64 | 影响 HNSW 索引构建时的图层连接数,数值越大召回率越高但构建时间增加 |
ef_search | 32 | 影响 HNSW 索引查询时的邻居搜索数,数值越大召回率越高但查询延迟增加 |
m = 32 | 32 | HNSW 索引的每层最大连接数,影响索引大小与查询效率的平衡 |
vector_ip_ops | true | pgvector 向量计算操作符,确保使用内积距离计算 |
max_connections | 100 | 数据库最大并发连接数,需根据 FastGPT 实例数和并发请求量调整 |
这两者互相约束的地方
模型上下文长度与向量库召回内容之间存在直接的预算关系。召回的段落条数乘以每段平均长度,其总和必须控制在 8000 Token 上下文长度以内,以确保模型能够完整处理所有输入。引用上限按 Token 计,而向量库返回的是独立的段落条数。当每段内容较短时,可能会先达到模型处理的段落条数限制,再触及引用上限;当每段内容较长时,则可能先触及引用上限,即使返回的段落条数不多。PostgreSQL(pgvector)的索引参数,如 ef_construction 和 ef_search,调大后可以提高向量检索的召回率,这意味着向量库能够更准确地找到与查询相关的内容。高召回率有助于为 glm-4v-flash 模型提供更优质的引用素材,使其在 6000 Token 的引用预算内构建出更准确、更丰富的回答。
容易做错的三处
- 日志显示「PostgreSQL connection refused」,原因可能是
PG_URL中的主机或端口配置不正确。 - FastGPT 界面返回的回答缺乏相关性,原因可能是
ef_search参数设置过低,导致向量检索未能找到足够多的相关段落。 - 插入向量数据时出现「value too long for type vector(1536)」错误,原因可能是向量维度与 pgvector 表字段定义不符。
怎么确认配好了
- 执行一次完整的 RAG 流程,检查 FastGPT 返回的回答是否包含从知识库召回的内容,并通过日志确认数据库查询成功。
- 在 PostgreSQL 数据库中执行
SELECT * FROM pg_stat_activity WHERE datname = 'your_database_name';命令,确认连接数符合预期,没有大量空闲连接。 - 使用
EXPLAIN ANALYZE命令分析 pgvector 索引查询的性能,确保查询时间在可接受范围内。 - 定期检查 FastGPT 日志输出,确认没有数据库相关的错误信息或警告。