这一档模型的参数意味着什么
glm-5.1、glm-5、glm-5-turbo、glm-4.7、glm-4.7-flashx、glm-4.7-flash、glm-4.6 等模型,其 200000 的上下文长度为单次模型推理提供了充裕的输入空间,这意味着在 RAG 场景下可以纳入更多的召回文档片段。单次最大输出未标注,通常表示模型会根据输入和任务智能决定输出长度,但实际应用中仍受 FastGPT 平台或其他调用端限制。200000 的引用上限,表明模型理论上能处理大量的引用段落,但在实际 RAG 流程中,这通常会与向量库的召回条数和单段文字长度结合考量。不支持图片输入,意味着此档模型无法直接处理图像信息,涉及多模态的场景需要额外预处理。支持工具调用,则允许模型通过 Function Calling 与外部系统交互,扩展其能力边界。
配 PostgreSQL(pgvector) 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PG_URL | postgresql://user:password@host:port/database | 数据库连接标准格式,确保 FastGPT 能正确连接到 pgvector 实例。 |
ef_construction | 64 | HNSW 索引构建时搜索的邻居数量,影响索引质量与构建时间,32 至 128 之间为常见取值。 |
ef_search | 32 | HNSW 索引查询时搜索的邻居数量,影响召回精度与查询速度,通常小于或等于 ef_construction。 |
m | 16 | HNSW 索引图中每个节点的最大连接数,影响索引大小和查询性能,8 至 32 之间为常见取值。 |
vector_ip_ops | true | 启用内积(Inner Product)作为向量相似度计算方式,适用于模型输出的向量。 |
| 最大连接数 | 50–100 | 根据 FastGPT 实例并发量和数据库服务器资源进行调整,防止连接池耗尽。 |
这两者互相约束的地方
200000 的模型上下文预算是核心约束。向量库返回的召回条数与每段文字的平均长度之积,必须小于此上下文长度,才能确保所有召回内容都能被模型处理。例如,如果每段召回内容平均 500 字符,那么向量库最多召回 400 条。模型 200000 的引用上限与向量库返回的条数协同作用,实际生效的是两者中较小的值。在 pgvector 中,ef_construction 和 ef_search 等索引参数调大,通常能提升召回精度,从而为模型提供更相关的上下文。然而,这也会增加向量查询的延迟,可能导致模型在等待向量检索结果时出现卡顿,影响整体响应时间。因此,需要在此之间取得平衡,确保在模型处理能力范围内提供高质量的召回。
容易做错的三处
- 日志中出现
connection refused错误,原因是PG_URL配置中的主机名或端口号不正确,导致 FastGPT 无法建立数据库连接。 - RAG 响应内容质量不佳,但模型看起来没有问题,原因可能是 pgvector 的
ef_search值过低,导致召回的向量不够精确,未能提供模型所需的核心信息。 - FastGPT 平台显示召回条数远低于预期,原因可能是数据库连接池设置过小,在高并发请求下无法及时获取连接,导致部分查询超时或失败。
怎么确认配好了
- 在 FastGPT 平台知识库测试界面,使用测试问题进行检索,观察返回的召回文档片段数量是否与预期一致,并检查召回内容的语义相关性。
- 监控 FastGPT 服务的日志,确认没有出现与 pgvector 相关的连接错误、查询超时或索引异常等报错信息。
- 通过数据库性能监控工具,观察 pgvector 索引的查询延迟和资源占用情况,确保在预期负载下查询时间稳定,并根据实际情况调整
ef_search等参数的阈值。 - 在 FastGPT 中配置一个包含大量文档的知识库,并进行多轮对话测试,验证模型能够稳定地引用知识库内容,且引用条数在模型引用上限和向量库召回条数的限制内。