模型指南官方文档3 分钟阅读模型组合页

ChatGLM 16K 上下文 这一档模型配 OceanBase 的配置口径

`glm-4v-plus` 模型上下文长度为 16000 token,这决定了单次模型调用能处理的总信息量,包括用户输入、系统指令和召回内容。单次最大输出未标注,意味着模型在输出长度上可能存在灵活度。引用上限为 12000 token,这是专门分配给召回内容的总预算,确保模型有足够空间消化检索到的信

这一档模型的参数意味着什么

glm-4v-plus 模型上下文长度为 16000 token,这决定了单次模型调用能处理的总信息量,包括用户输入、系统指令和召回内容。单次最大输出未标注,意味着模型在输出长度上可能存在灵活度。引用上限为 12000 token,这是专门分配给召回内容的总预算,确保模型有足够空间消化检索到的信息。图片输入能力支持处理图像数据,拓展了多模态应用的场景。工具调用功能缺失,意味着此模型版本不直接支持通过函数调用与外部系统交互。

配 OceanBase 要定哪些

配置项建议取法这样取的依据
OCEANBASE_URLob://user:pass@host:port/database数据库连接字符串,确保可达性
ef_construction80索引构建质量与速度的平衡,影响召回效果
m=1616HNSW 图结构参数,影响召回精度与内存占用
recall_top_k前 5 条经验值,兼顾模型引用上限与信息密度
chunk_size800–1200 字符适应模型上下文,避免单段过长或过短
embedding_modeltext-embedding-v2确保与向量化处理过程一致

这两者互相约束的地方

模型 16000 token 的上下文长度是总容量,它限制了用户输入、系统指令与召回内容的总和。其中,引用上限 12000 token 专用于召回内容。向量库返回的段落数量和每段的字符长度共同决定了召回内容占用的 token 数。如果单段过长,即便召回条数不多,也可能迅速触及引用上限。反之,如果单段很短,即使召回条数多,也可能在引用上限允许的范围内。OceanBase 的 ef_construction 和 m 参数调大,通常会提升召回的准确性,这意味着模型能够获得更高质量的输入,但同时也会增加向量索引的构建时间和查询延迟,需要在系统响应速度和召回效果之间找到平衡点。

容易做错的三处

  • OCEANBASE_URL 配置错误,导致 FastGPT 启动时报错 Failed to connect to OceanBase。
  • ef_construction 或 m 值设置过低,导致召回结果相关性差,用户反馈“回答不准确”。
  • 向量库返回的段落内容为空,模型生成回复时出现“未能找到相关信息”的提示。

怎么确认配好了

  • 检查 FastGPT 启动日志,确认 OceanBase connection successful 信息。
  • 使用 FastGPT 的测试召回功能,观察返回段落的相关性与数量,根据实际业务需求调整 recall_top_k 参数。
  • 在 FastGPT 中上传文档并创建知识库,观察向量化任务是否成功完成,并检查 OceanBase 中是否存在对应的向量数据。

参考资料