这一档模型的参数意味着什么
ChatGLM 200K 上下文模型系列,其上下文长度高达 200000 token,这决定了单次请求中可供模型处理的输入总容量,包括用户查询、系统指令以及检索到的上下文内容。引用上限为 200000 token,这意味着模型在生成回答时,引用内容的总量不会超过此限制。工具调用功能的支持,使得模型能够执行预设的外部操作。图片输入为 false,表明此档模型不直接处理图像信息。这些参数共同构成了模型在工程应用中的能力边界与资源消耗。
配 OceanBase 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OCEANBASE_URL | ob://user:password@host:port/database | 连接 OceanBase 数据库实例的统一资源定位符 |
ef_construction | 64 | 向量索引构建时的邻居数量,影响索引质量与构建速度 |
m=16 | 16 | HNSW 索引中每个节点的最大连接数,影响检索性能与内存占用 |
| 文本分段大小 | 800–1200 字符 | 兼顾语义完整性与召回条数,避免单段过长 |
| 召回条数 | 前 5–10 条 | 结合引用上限与段落平均长度,确保有效信息密度 |
| 向量维度 | 1536 | 与所选嵌入模型输出向量维度保持一致 |
这两者互相约束的地方
召回条数与每段长度的乘积,必须严格控制在模型的上下文长度预算之内。引用上限是按 token 计算的,而向量库返回的是独立的段落条数,两者触顶的先后顺序取决于每个段落的平均 token 长度。当向量库返回的段落平均较短时,引用上限可能在达到最大召回条数前触顶;反之,若段落平均较长,则召回条数可能提前达到上限。对于 OceanBase,索引参数 ef_construction 和 m 调大,通常意味着向量搜索的准确率提升,但也会增加索引构建时间和查询延迟。对于 ChatGLM 200K 上下文这类高容量模型,更精确的召回有助于模型聚焦于相关信息,但高延迟的检索可能抵消模型处理大上下文的优势。
容易做错的三处
- 日志显示「数据库连接超时」,通常是
OCEANBASE_URL中的主机或端口配置不正确。 - 检索结果为空或不相关,可能是向量库索引参数
ef_construction或m设置过低,导致召回精度不足。 - 模型回答缺乏引用来源,排查发现 FastGPT 界面提示「引用内容超限」,原因在于单次召回内容总 token 量超过了模型的引用上限。
怎么确认配好了
- 通过 FastGPT 的调试界面,观察每次模型调用的输入 token 数,确认召回内容总量未超出模型的上下文长度。
- 在 OceanBase 数据库中执行
SHOW INDEX命令,检查向量索引的ef_construction和m参数是否已按预期配置。 - 测试不同查询,观察 FastGPT 返回的引用段落,评估其与查询的相关性,并结合模型回答质量来确定
ef_construction和m的合适阈值。 - 通过 FastGPT 的引用管理功能,确认召回的段落条数与每段字符数,以推算引用内容的总 token 量,确保其在引用上限之内。