这一档模型的参数意味着什么
Moonshot 8K 上下文模型提供了 8000 Token 的上下文长度,这意味着在单次对话中,模型可以处理最多 8000 Token 的输入信息,包括历史对话、系统指令和检索到的知识内容。其 6000 Token 的引用上限,限定了从知识库中检索并实际送入模型进行引用的内容总量。工具调用能力的存在,允许模型在需要时执行外部函数以获取最新信息或完成特定任务。由于图片输入为 false,此模型不具备直接处理图像信息的能力,所有输入内容需转换为文本形式。单次最大输出未标注,通常意味着模型会根据输入内容和上下文自行判断合适的输出长度,但仍受限于总上下文长度。
配 openGauss 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OPENGAUSS_URL | postgresql://user:password@host:port/database | 数据库连接字符串,确保 FastGPT 能正确连接 openGauss 实例。 |
ef_construction | 64 | HNSW 索引构建参数,影响索引质量和构建速度。过低可能导致召回精度下降,过高则会增加索引构建时间。 |
ef_search | 32 | HNSW 索引搜索参数,影响搜索精度和速度。应大于或等于 m 的值。 |
m | 32 | HNSW 索引的邻居数量参数,影响索引图的稠密程度。 |
| 召回条数 | 前 5 条 | 根据 6000 Token 引用上限和经验单段长度,避免单次检索内容超出模型处理能力。 |
| 单段文本长度 | 800–1200 字符 | 确保每段内容具有足够信息量,同时避免过长导致上下文溢出。 |
这两者互相约束的地方
Moonshot 8K 上下文模型与 openGauss 向量库的配置存在紧密约束。首先,召回条数与每段文本长度的乘积,加上历史对话和系统指令所占用的 Token 数,不能超过模型 8000 Token 的上下文长度预算。超出部分将被截断,导致信息丢失。其次,模型的 6000 Token 引用上限,意味着即使 openGauss 返回了大量相关度高的向量,实际被模型引用的内容也受此上限限制。因此,在 openGauss 中设置的召回条数,应结合单段文本长度进行估算,以确保最终引用内容不超过 6000 Token。openGauss 的索引参数 ef_construction 和 ef_search 调大,会提高向量搜索的召回精度,但也可能增加搜索延迟。对于该模型而言,高精度的召回有助于在有限的引用上限内提供更相关的上下文,但过高的延迟则会影响整体响应速度。
容易做错的三处
- 现象:模型返回「上下文长度超出限制」错误码。原因:向量库召回的条数过多或单段文本过长,导致总输入 Token 数超过 8000。
- 现象:模型回答缺乏特定知识,甚至「幻觉」。原因:openGauss 的
ef_search参数过低,导致向量搜索精度不足,未能召回最相关的知识片段。 - 现象:检索响应时间过长,导致模型回答缓慢或超时。原因:openGauss 的
ef_construction或m参数设置过大,导致索引构建或查询开销过高。
怎么确认配好了
- 验证 FastGPT 日志中是否出现 openGauss 的连接成功信息,并检查
OPENGAUSS_URL环境变量是否正确解析。 - 在 FastGPT 知识库管理界面,上传并切分大量文档,观察切分后的文本段长度是否符合
800–1200 字符的预期范围。 - 针对特定查询,在 FastGPT 调试模式下观察模型实际引用了多少 Token 的知识内容,并与 6000 Token 的引用上限进行对比,确认召回条数与单段长度配置合理。