这一档模型的参数意味着什么
glm-4-long 模型,上下文长度高达 1,000,000 token,意味着单次请求可以承载极大规模的输入信息,为复杂场景下的深度理解和推理提供了基础。引用上限 900,000 token 专门用于约束检索内容的总量,确保模型在生成回复时能充分利用外部知识,同时避免因引用过长而超出总上下文。单次最大输出未标注,通常由模型内部机制或平台默认值决定。图片输入 false 和工具调用 false 表明此模型版本专注于文本处理,不具备多模态输入能力或通过外部工具扩展功能的能力。
配 openGauss 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OPENGAUSS_URL | postgresql://user:password@host:port/database | FastGPT 连接 openGauss 数据库的标准格式,确保网络可达与凭证正确。 |
ef_construction | 600 | 建立索引时的搜索深度,更高的值会提高索引质量和召回率,但会增加索引构建时间。 |
ef_search | 150 | 运行时搜索的邻居数量,适当调高能提升召回精度,但会增加查询耗时。 |
m | 32 | HNSW 图中的最大邻居数量,影响图的稠密程度,值越大召回效果越好,但索引体积和查询开销也越大。 |
| 召回条数 | 5-10 条 | 结合模型引用上限与单段平均 token 数,优化引用效率。 |
| 单段最大字符数 | 500-800 字符 | 避免单段内容过长,导致模型处理负担或引用上限提前触及。 |
这两者互相约束的地方
glm-4-long 模型高达 900,000 token 的引用上限,与 openGauss 向量库的检索结果条数并非直接等同。引用上限是模型处理检索内容的 token 预算,而向量库返回的是固定数量的文档段落。如果每段内容较长,即使召回条数不多,也可能迅速触及引用上限;反之,若单段内容精炼,则可在引用上限内召回更多段落。因此,在 openGauss 中配置的召回条数与每段文档的字符长度,需要共同在总上下文 1,000,000 token 的范围内进行平衡。调高 openGauss 的索引参数 ef_construction 和 ef_search,虽然能提升召回的准确性,但也可能增加查询延迟,这需要与模型响应时间需求进行权衡。
容易做错的三处
- 日志显示
Context length exceeded:原因可能是检索出的内容总 token 数,加上用户输入,超过了 1,000,000 的上下文限制。 - 模型回复内容缺少关键信息,但相关文档已召回:原因可能是引用内容总 token 数达到了 900,000 的引用上限,导致部分召回文档未能被模型处理。
- 查询响应时间过长:原因可能是 openGauss 的
ef_search参数设置过高,导致向量检索耗时增加。
怎么确认配好了
- 对典型查询,检查 FastGPT 界面中模型实际引用的内容 token 数,确认其未超出 900,000 的引用上限。
- 通过 FastGPT 的日志输出,观察每次请求的总上下文长度,确保其在 1,000,000 token 范围内。
- 使用 FastGPT 提供的调试工具,验证 openGauss 向量检索返回的文档与预期相关性,并根据业务需求设定合格的召回率阈值。