模型指南官方文档3 分钟阅读模型组合页

ChatGLM 64K 上下文 这一档模型配 OceanBase 的配置口径

`glm-4.1v-thinking-flashx` 和 `glm-4.1v-thinking-flash` 模型拥有 64000 的上下文长度,这意味着单次请求中模型可以处理的总输入文本量。引用上限 60000 规定了引用内容能够占用的 token 预算,这限制了模型在生成回复时可以参考的外部知识

这一档模型的参数意味着什么

glm-4.1v-thinking-flashx 和 glm-4.1v-thinking-flash 模型拥有 64000 的上下文长度,这意味着单次请求中模型可以处理的总输入文本量。引用上限 60000 规定了引用内容能够占用的 token 预算,这限制了模型在生成回复时可以参考的外部知识量。图片输入支持表示模型能够处理多模态信息,而工具调用不支持,表明该档模型不具备直接执行外部工具的能力。单次最大输出未标注,实际应用中需通过试验确定其生成内容的最大长度。

配 OceanBase 要定哪些

配置项建议取法这样取的依据
OCEANBASE_URLob://user:pass@host:port/database连接 OceanBase 数据库实例的唯一标识
ef_construction128影响 HNSW 索引构建质量和搜索速度,权衡性能与精度
m16HNSW 索引中每个节点的最大邻居数,影响召回质量和内存消耗
top_k前 5 条向量检索时返回的相似文档数量,直接影响召回条数
chunk_size800–1200 字符文档切片的大小,影响单段内容的粒度和token消耗
SEEKDB_URLob://user:pass@host:port/databaseSEEKDB 与 OceanBase 配置口径相同,复用连接参数

这两者互相约束的地方

召回条数与每段内容长度共同决定了总的引用内容量,此总量不能超出模型的上下文长度预算。引用上限按 token 计,向量库返回的按条数计,谁先触顶取决于每段内容的平均 token 长度。当 OceanBase 的索引参数 ef_construction 和 m 调大时,向量检索的精度通常会提高,这可能意味着更相关的召回结果。对于这一档模型而言,更精确的召回可以帮助模型更好地利用其 60000 的引用上限,但同时,更高的索引精度也可能增加向量检索的延迟,需要权衡。

容易做错的三处

  • 日志显示“连接数据库失败”,原因为 OCEANBASE_URL 配置字符串格式错误或连接信息不正确。
  • 检索结果返回条数不符合预期,原因为 top_k 参数设置过小,导致召回数量不足。
  • 模型回答内容缺乏相关性,原因为 ef_construction 或 m 参数设置过低,导致向量索引召回精度不足。

怎么确认配好了

  • 检查 OceanBase 连接状态,确认 OCEANBASE_URL 配置正确且服务可访问。
  • 执行一次带引用内容的问答,观察引用内容是否在引用上限 token 范围内且内容完整。
  • 通过 FastGPT 后台的检索测试功能,验证向量召回的条数和相关性是否符合预期,并根据实际需求调整 ef_construction 和 m 参数。

参考资料