模型指南官方文档4 分钟阅读模型组合页

ChatGLM 200K 上下文 这一档模型配 openGauss 的配置口径

`glm-5v-turbo` 模型提供的上下文长度高达 200000 token,这意味着单次请求可以处理非常庞大的文本输入,为复杂的问答和文档分析任务提供了充足的空间。引用上限同样设定在 200000 token,这表示在构建 RAG(检索增强生成)流程时,模型可以预算到足够多的引用内容,以支持其

这一档模型的参数意味着什么

glm-5v-turbo 模型提供的上下文长度高达 200000 token,这意味着单次请求可以处理非常庞大的文本输入,为复杂的问答和文档分析任务提供了充足的空间。引用上限同样设定在 200000 token,这表示在构建 RAG(检索增强生成)流程时,模型可以预算到足够多的引用内容,以支持其生成高质量的回答。模型支持图片输入,允许在对话中融入视觉信息,拓宽了应用场景。工具调用能力则使其能够与外部系统集成,执行特定功能或获取实时数据,提升了模型的实用性。

配 openGauss 要定哪些

配置项建议取法这样取的依据
OPENGAUSS_URLpostgresql://user:password@host:port/database数据库连接字符串,确保 FastGPT 能正确连接 openGauss 实例
ef_construction64HNSW 索引构建参数,影响索引质量与构建速度,兼顾查询性能与索引大小
ef_search32HNSW 索引搜索参数,决定搜索召回率,提高搜索质量
m32HNSW 图结构参数,影响索引的内存占用和搜索效率,平衡性能与资源消耗
vector_dimension1024向量维度,与模型嵌入输出维度保持一致
recall_chunk_size500–800 字符单个召回文本块的理想长度,兼顾信息完整性和模型上下文处理效率

这两者互相约束的地方

glm-5v-turbo 模型的 200K 上下文长度为 openGauss 向量库的检索结果提供了广阔的承载空间。向量库检索出的段落条数与每段内容的长度共同决定了总的 token 消耗,这个总和不应超过模型的上下文长度预算。引用上限是模型处理引用内容的 token 预算,它限定了引用内容的总 token 数。向量库返回的结果以条数计,每条内容的长度不同,因此,是引用上限先触及还是向量库返回条数先触及总 token 限制,取决于每段内容的平均长度。当 openGauss 的 ef_construction 和 ef_search 等索引参数调大时,通常意味着更高的召回率和更精确的搜索结果,这为 glm-5v-turbo 模型提供了更丰富的上下文,但也可能增加检索耗时。

容易做错的三处

  • 日志中出现 connection refused 错误,原因是 OPENGAUSS_URL 配置的数据库地址或端口不正确,导致 FastGPT 无法建立连接。
  • 检索结果返回条数远低于预期,原因是向量索引的 ef_search 值设置过低,导致搜索过程中未能充分探索邻近节点。
  • 模型返回的回答中引用的内容与检索结果不符,原因是向量化服务与 openGauss 存储的向量维度不一致,导致向量匹配错误。

怎么确认配好了

  • 检查 FastGPT 运行日志,确认无 openGauss 相关的连接错误或索引构建异常。
  • 在 FastGPT 控制台进行一次 RAG 问答测试,观察检索到的内容是否与预期相关,并验证模型是否正确引用了这些内容。
  • 通过 openGauss 数据库客户端,查询 pg_stat_activity 表,确认 FastGPT 正在正常连接并执行查询操作,并根据应用负载确定 max_connections 的合理阈值。

参考资料