模型指南官方文档4 分钟阅读模型组合页

ChatGLM 128K 上下文 这一档模型配 OceanBase 的配置口径

这一档模型(`glm-4.6v`、`glm-4.6v-flashx`、`glm-4.6v-flash`)的上下文长度为 128000 Token,决定了单次模型调用能够处理的输入信息总量,包括系统指令、用户查询和召回的知识内容。引用上限 120000 Token 约束了知识库召回内容在上下文中的最大

这一档模型的参数意味着什么

这一档模型(glm-4.6v、glm-4.6v-flashx、glm-4.6v-flash)的上下文长度为 128000 Token,决定了单次模型调用能够处理的输入信息总量,包括系统指令、用户查询和召回的知识内容。引用上限 120000 Token 约束了知识库召回内容在上下文中的最大占比。单次最大输出未标注,意味着其输出长度主要受限于整体上下文长度和模型自身生成能力。图片输入为 true,使得模型能够处理多模态输入,支持图文混合的问答场景。工具调用为 true,则允许模型通过外部工具扩展其能力,实现更复杂的任务。

配 OceanBase 要定哪些

配置项建议取法这样取的依据
OCEANBASE_URLob://user:password@host:port/database连接 OceanBase 实例的必要信息,包含认证与地址。SEEKDB 也遵循此协议。
ef_construction64HNSW 索引构建参数,影响索引质量与构建速度。过小影响召回质量,过大增加索引时间。
m=1616HNSW 索引图的每个节点连接的最大邻居数,影响召回精度与查询耗时。
召回条数 top_k5 至 10 条结合模型引用上限与单段平均长度,避免上下文溢出。
单段最大字符数800 至 1200 字符经验值,确保每段信息完整且不过长。
向量维度 vector_dim1536与所选嵌入模型输出维度保持一致。

这两者互相约束的地方

模型上下文长度是核心约束。召回条数与每段长度的乘积,加上系统指令和用户查询的 Token 数量,必须小于或等于模型的上下文长度 128000 Token。如果超出,模型会截断输入,导致信息丢失。引用上限 120000 Token 进一步限制了知识库内容在整个上下文中的最大可用空间。向量库的 top_k 参数(召回条数)应与此引用上限协同设置,确保召回的段落总数和总长度在模型处理范围内。当 OceanBase 的 ef_construction 和 m 等索引参数调大时,向量搜索的精度会提高,可能带来更相关的召回结果。这意味着模型能获得更高质量的输入,但同时索引构建和查询的资源消耗也会增加。

容易做错的三处

  • 日志中出现 Context window exceeded 错误码:原因在于召回内容总长度加上用户输入超过了 128000 Token 的上下文限制。
  • 模型返回的答案缺乏关键信息:原因可能是向量库的 top_k 设置过小,导致相关信息未能被召回。
  • 向量搜索请求超时或延迟过高:原因可能是 ef_construction 或 m 参数设置过大,导致索引查询计算量剧增。

怎么确认配好了

  • 在 FastGPT 知识库测试界面,上传文档并进行问答,观察召回条数是否符合预期,以及回答是否准确。
  • 通过 FastGPT 的调试模式,查看每次模型调用实际传入的 Token 数量,确保其在 128000 Token 范围内。
  • 检查 OceanBase 的日志,确认向量查询响应时间符合业务要求,没有出现大量慢查询。
  • 在 FastGPT 管理后台,检查 OceanBase 连接状态,确认 OCEANBASE_URL 配置正确且可达。

参考资料