这一档模型的参数意味着什么
glm-4-long 模型具备 1000K 的上下文长度,这决定了单次模型调用能够处理的输入信息总量。引用上限 quoteMaxToken 为 900000,这意味着在 RAG 场景下,模型用于接收引用内容的 token 预算是 900000。这个上限限定了所有引用内容合计的 token 消耗,而与召回的段落条数是两个独立的概念。单次最大输出未明确标注,通常由模型自身能力决定,但最终输出长度也受限于总上下文。此模型不支持图片输入与工具调用,因此无法通过这些通道扩展输入或执行外部操作。
配 OceanBase 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OCEANBASE_URL | ob://user:pass@host:port/database | 连接 OceanBase 实例所需的标准连接字符串,确保权限与网络可达。 |
ef_construction | 64 | HNSW 索引构建参数,影响索引质量与构建速度,64 是一个平衡的起点。 |
m | 16 | HNSW 索引图的邻居数量参数,影响召回精度,16 通常能提供较好的召回效果。 |
top_k | 5 | 向量检索时返回的相似度最高条数,与模型引用上限配合使用。 |
chunk_size | 800–1200 字符 | 文档切分时每个段落的平均字符数,影响单段信息密度。 |
chunk_overlap | 100 字符 | 文档切分时相邻段落的重叠字符数,用于保持上下文连贯性。 |
这两者互相约束的地方
glm-4-long 模型高达 1000K 的上下文长度提供了巨大的信息处理空间。然而,向量库返回的召回条数与每段内容的长度需要共同适配这个上下文预算。引用上限 quoteMaxToken 限制的是引用内容的总 token 消耗,而向量库返回的是固定数量的段落。当检索到的段落数量过多,或者单个段落切分过长时,总 token 数可能首先触达 quoteMaxToken,即使上下文长度仍有余量。反之,如果段落较短,则可能在达到 quoteMaxToken 之前,先达到一个合理的段落数量。OceanBase 的索引参数 ef_construction 和 m 调大后,通常会提高召回的准确性,但也会增加索引构建时间和查询延迟,这对于需要快速响应的 RAG 应用来说是需要权衡的因素。优化召回质量可以减少模型处理无关信息的负担。
容易做错的三处
- 日志中出现
OceanBase connection failed: authentication error:OCEANBASE_URL中的用户名或密码不正确,或 IP 白名单未配置。 - 检索结果返回条数远低于预期,或返回为空:
top_k设置过小,或向量索引尚未完全构建。 - RAG 链路最终回复内容过短或不完整:引用内容总 token 超出
quoteMaxToken,导致部分召回内容被截断。
怎么确认配好了
- 检查 FastGPT 后台 OceanBase 连接状态,确认显示“已连接”。
- 导入一批测试文档,执行向量检索,确认
top_k参数生效,返回指定数量的相似文档片段。 - 针对一个包含大量引用内容的查询,查看 FastGPT RAG 链路的上下文输入,确认引用内容的总 token 量未超过
quoteMaxToken。 - 部署应用后,监控 OceanBase 实例的查询延迟和资源消耗,确认
ef_construction和m参数在生产环境下的性能表现符合预期。