这一档模型的参数意味着什么
glm-5v-turbo 模型提供的上下文长度高达 200000 token,这意味着单次请求可以处理非常庞大的文本输入,为复杂的问答和文档分析任务提供了充足的空间。引用上限同样设定在 200000 token,这表示在构建 RAG(检索增强生成)流程时,模型可以预算到足够多的引用内容,以支持其生成高质量的回答。模型支持图片输入,允许在对话中融入视觉信息,拓宽了应用场景。工具调用能力则使其能够与外部系统集成,执行特定功能或获取实时数据,提升了模型的实用性。
配 openGauss 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OPENGAUSS_URL | postgresql://user:password@host:port/database | 数据库连接字符串,确保 FastGPT 能正确连接 openGauss 实例 |
ef_construction | 64 | HNSW 索引构建参数,影响索引质量与构建速度,兼顾查询性能与索引大小 |
ef_search | 32 | HNSW 索引搜索参数,决定搜索召回率,提高搜索质量 |
m | 32 | HNSW 图结构参数,影响索引的内存占用和搜索效率,平衡性能与资源消耗 |
vector_dimension | 1024 | 向量维度,与模型嵌入输出维度保持一致 |
recall_chunk_size | 500–800 字符 | 单个召回文本块的理想长度,兼顾信息完整性和模型上下文处理效率 |
这两者互相约束的地方
glm-5v-turbo 模型的 200K 上下文长度为 openGauss 向量库的检索结果提供了广阔的承载空间。向量库检索出的段落条数与每段内容的长度共同决定了总的 token 消耗,这个总和不应超过模型的上下文长度预算。引用上限是模型处理引用内容的 token 预算,它限定了引用内容的总 token 数。向量库返回的结果以条数计,每条内容的长度不同,因此,是引用上限先触及还是向量库返回条数先触及总 token 限制,取决于每段内容的平均长度。当 openGauss 的 ef_construction 和 ef_search 等索引参数调大时,通常意味着更高的召回率和更精确的搜索结果,这为 glm-5v-turbo 模型提供了更丰富的上下文,但也可能增加检索耗时。
容易做错的三处
- 日志中出现
connection refused错误,原因是OPENGAUSS_URL配置的数据库地址或端口不正确,导致 FastGPT 无法建立连接。 - 检索结果返回条数远低于预期,原因是向量索引的
ef_search值设置过低,导致搜索过程中未能充分探索邻近节点。 - 模型返回的回答中引用的内容与检索结果不符,原因是向量化服务与 openGauss 存储的向量维度不一致,导致向量匹配错误。
怎么确认配好了
- 检查 FastGPT 运行日志,确认无 openGauss 相关的连接错误或索引构建异常。
- 在 FastGPT 控制台进行一次 RAG 问答测试,观察检索到的内容是否与预期相关,并验证模型是否正确引用了这些内容。
- 通过 openGauss 数据库客户端,查询
pg_stat_activity表,确认 FastGPT 正在正常连接并执行查询操作,并根据应用负载确定max_connections的合理阈值。