模型指南官方文档4 分钟阅读模型组合页

ChatGLM 64K 上下文 这一档模型配 openGauss 的配置口径

`glm-4.1v-thinking-flashx` 和 `glm-4.1v-thinking-flash` 模型提供高达 64000 token 的上下文长度,这意味着在单次交互中可以处理大量输入信息。模型支持图片输入,可用于处理多模态检索与生成任务。引用上限为 60000 token,这是模型用

这一档模型的参数意味着什么

glm-4.1v-thinking-flashx 和 glm-4.1v-thinking-flash 模型提供高达 64000 token 的上下文长度,这意味着在单次交互中可以处理大量输入信息。模型支持图片输入,可用于处理多模态检索与生成任务。引用上限为 60000 token,这是模型用于生成回答时,从检索结果中引用的内容总量限制。段落条数由向量检索返回的数量决定,引用上限与段落条数是两个独立的量。工具调用功能在此档模型中未开放,因此无法通过模型直接集成外部工具进行复杂任务处理。

配 openGauss 要定哪些

配置项建议取法这样取的依据
OPENGAUSS_URLpostgresql://user:password@host:port/database数据库连接字符串,确保可达性
ef_construction64控制 HNSW 索引构建时的邻居数量,影响索引质量和构建时间
ef_search32控制 HNSW 索引查询时的邻居数量,影响查询召回率和速度
m = 3232HNSW 索引中每个节点的最大连接数,影响索引大小和查询性能
recall_max_docs前 10 条向量检索返回的最大文档条数,影响模型可引用的内容量
chunk_size800–1200 字符单个文档块的字符长度,影响模型理解和引用粒度

这两者互相约束的地方

模型的上下文预算为 64000 token,而引用上限为 60000 token。向量库返回的召回条数与每段内容的长度共同决定了最终输入模型的内容总量。当召回条数乘以每段的 token 长度超过 60000 token 的引用上限时,模型将只截取前 60000 token 进行引用。如果召回内容的总 token 量未达到引用上限,但已触及 64000 token 的上下文长度限制,则其余输入内容(如用户提问)会被截断。openGauss 的 ef_construction 和 ef_search 参数调大,通常能提升检索的召回率和准确性,这对于需要高质量引用的模型而言至关重要。更高的召回质量意味着模型有更精准的信息源,从而在引用上限允许的范围内生成更相关的回答。

容易做错的三处

  • 向量检索结果为空,模型无法生成有效回答。原因在于向量库索引未正确构建,或查询条件与数据不匹配。
  • 模型返回的回答长度异常短,且提示引用内容不足。原因在于 recall_max_docs 配置过小,或 chunk_size 过大导致单次检索内容量不足以支撑回答。
  • 数据库连接超时或认证失败。原因在于 OPENGAUSS_URL 中主机、端口、用户或密码配置错误,导致无法连接 openGauss 实例。

怎么确认配好了

  • 通过 FastGPT 平台界面,查看知识库检索日志,确认 openGauss 返回的文档条数符合预期 recall_max_docs 配置。
  • 在知识库中上传不同长度的文档,观察分段后的 chunk_size 是否在预期范围内。
  • 针对特定查询,检查模型生成的回答中引用的内容,评估引用内容的相关性和完整性,并根据需要调整 ef_construction 和 ef_search 参数。

参考资料