模型指南官方文档4 分钟阅读模型组合页

ChatGLM 200K 上下文 这一档模型配 OceanBase 的配置口径

ChatGLM 200K 上下文模型系列,其上下文长度高达 200000 token,这决定了单次请求中可供模型处理的输入总容量,包括用户查询、系统指令以及检索到的上下文内容。引用上限为 200000 token,这意味着模型在生成回答时,引用内容的总量不会超过此限制。工具调用功能的支持,使得模型能

这一档模型的参数意味着什么

ChatGLM 200K 上下文模型系列,其上下文长度高达 200000 token,这决定了单次请求中可供模型处理的输入总容量,包括用户查询、系统指令以及检索到的上下文内容。引用上限为 200000 token,这意味着模型在生成回答时,引用内容的总量不会超过此限制。工具调用功能的支持,使得模型能够执行预设的外部操作。图片输入为 false,表明此档模型不直接处理图像信息。这些参数共同构成了模型在工程应用中的能力边界与资源消耗。

配 OceanBase 要定哪些

配置项建议取法这样取的依据
OCEANBASE_URLob://user:password@host:port/database连接 OceanBase 数据库实例的统一资源定位符
ef_construction64向量索引构建时的邻居数量,影响索引质量与构建速度
m=1616HNSW 索引中每个节点的最大连接数,影响检索性能与内存占用
文本分段大小800–1200 字符兼顾语义完整性与召回条数,避免单段过长
召回条数前 5–10 条结合引用上限与段落平均长度,确保有效信息密度
向量维度1536与所选嵌入模型输出向量维度保持一致

这两者互相约束的地方

召回条数与每段长度的乘积,必须严格控制在模型的上下文长度预算之内。引用上限是按 token 计算的,而向量库返回的是独立的段落条数,两者触顶的先后顺序取决于每个段落的平均 token 长度。当向量库返回的段落平均较短时,引用上限可能在达到最大召回条数前触顶;反之,若段落平均较长,则召回条数可能提前达到上限。对于 OceanBase,索引参数 ef_construction 和 m 调大,通常意味着向量搜索的准确率提升,但也会增加索引构建时间和查询延迟。对于 ChatGLM 200K 上下文这类高容量模型,更精确的召回有助于模型聚焦于相关信息,但高延迟的检索可能抵消模型处理大上下文的优势。

容易做错的三处

  • 日志显示「数据库连接超时」,通常是 OCEANBASE_URL 中的主机或端口配置不正确。
  • 检索结果为空或不相关,可能是向量库索引参数 ef_construction 或 m 设置过低,导致召回精度不足。
  • 模型回答缺乏引用来源,排查发现 FastGPT 界面提示「引用内容超限」,原因在于单次召回内容总 token 量超过了模型的引用上限。

怎么确认配好了

  • 通过 FastGPT 的调试界面,观察每次模型调用的输入 token 数,确认召回内容总量未超出模型的上下文长度。
  • 在 OceanBase 数据库中执行 SHOW INDEX 命令,检查向量索引的 ef_construction 和 m 参数是否已按预期配置。
  • 测试不同查询,观察 FastGPT 返回的引用段落,评估其与查询的相关性,并结合模型回答质量来确定 ef_construction 和 m 的合适阈值。
  • 通过 FastGPT 的引用管理功能,确认召回的段落条数与每段字符数,以推算引用内容的总 token 量,确保其在引用上限之内。

参考资料