这一档模型的参数意味着什么
SparkDesk 32K 上下文模型提供了 32000 token 的上下文长度,这意味着模型一次处理的输入信息总量可达 32000 token。引用上限 quoteMaxToken 同样为 32000 token,这是对所有引用内容总计 token 量的预算。模型将根据此预算来决定最终呈现给用户的引用内容量。段落条数则由向量检索侧返回的匹配条目数量决定,两者是独立的概念。此档模型不具备图片输入和工具调用能力,因此无法通过这些通道获取额外信息或执行特定操作。
配 openGauss 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OPENGAUSS_URL | postgresql://user:password@host:port/database | 数据库连接标准格式,确保 FastGPT 能正确连接到 openGauss 实例。 |
ef_construction | 100–200 | 索引构建参数,影响索引质量与构建速度。提高此值可提升召回精度,但会增加构建时间。 |
ef_search | 50–100 | 搜索阶段参数,影响查询召回精度与查询速度。提高此值可增加召回率,但会消耗更多计算资源。 |
m | 32 | HNSW 索引参数,控制每个节点的最大连接数。此值平衡了索引大小、查询速度和召回质量。 |
| 每段召回字符数 | 500–800 字符 | 结合模型上下文长度与引用上限,优化单段信息的粒度,避免单段过长或过短。 |
| 检索返回条数 | 前 5–10 条 | 结合模型引用上限与每段字符数,避免返回过多冗余信息,同时保证关键信息覆盖。 |
这两者互相约束的地方
SparkDesk 32K 上下文模型的 32000 token 上下文长度与 openGauss 检索结果之间存在直接关联。召回条数与每段长度的乘积,必须控制在模型的上下文预算之内,以确保所有召回内容都能被模型有效处理。引用上限 quoteMaxToken 是一个按 token 计量的预算,而 openGauss 返回的是按条数计量的段落。具体哪个先触顶,取决于每个召回段落的实际 token 长度。如果段落较短,模型可能能处理更多条数;如果段落较长,则条数会相应减少。openGauss 的索引参数,如 ef_construction 和 ef_search,调大后可以提升召回精度,这意味着模型能获得更相关、更准确的输入,从而可能在给定引用预算内得到更优质的回复。
容易做错的三处
- 报错信息显示
Context window exceeded:原因在于召回内容总 token 量,加上用户输入,超出了模型的 32000 token 上下文限制。 - 返回结果中引用内容缺失或不完整:原因在于 openGauss 返回的段落总 token 量超出了模型的
quoteMaxToken预算,导致部分内容被截断。 - 查询响应时间显著增加:原因在于
ef_search参数设置过大,导致 openGauss 在搜索阶段消耗过多计算资源。
怎么确认配好了
- 在 FastGPT 界面查看每次对话的上下文 Token 消耗,确保
total_tokens不频繁触及 32000 上限。 - 通过 FastGPT 的调试工具查看召回内容,确认返回的引用段落数量与预期一致,且内容完整无截断。
- 定期监控 openGauss 的数据库连接状态和查询日志,确认连接
OPENGAUSS_URL正常,且查询响应时间在可接受范围内。 - 在 FastGPT 中进行多轮问答测试,观察模型回答的质量和引用内容的准确性,根据实际效果调整 openGauss 的
ef_construction和ef_search参数。