模型指南官方文档4 分钟阅读模型组合页

SparkDesk 8K 上下文 这一档模型配 openGauss 的配置口径

SparkDesk 8K 上下文模型系列,如 `generalv3`、`generalv3.5` 和 `4.0Ultra`,其上下文长度为 8000 token。这意味着单次模型请求中,输入和输出内容的总和不能超过此限制。引用上限 8000 token 规定了引用内容可用的 token 预算,即所有

这一档模型的参数意味着什么

SparkDesk 8K 上下文模型系列,如 generalv3、generalv3.5 和 4.0Ultra,其上下文长度为 8000 token。这意味着单次模型请求中,输入和输出内容的总和不能超过此限制。引用上限 8000 token 规定了引用内容可用的 token 预算,即所有被引用的文档片段合计可占用的最大 token 数。引用内容的段落条数由检索侧决定,与引用上限是两个独立的量。该档模型不支持图片输入和工具调用,因此相关功能链路不会被激活。

配 openGauss 要定哪些

配置项建议取法这样取的依据
OPENGAUSS_URLpostgresql://user:password@host:port/databaseFastGPT 连接 openGauss 数据库的标准格式,确保服务正常通信
ef_construction100-200构建 HNSW 索引时的邻居数量,数值越大索引质量越高,召回准确性提升
ef_search80-150搜索 HNSW 索引时的邻居数量,数值越大搜索精度越高,但查询耗时增加
m32HNSW 图中的最大邻居数,影响索引结构和查询性能,32 是通用平衡值
chunk_size800-1200 字符单个文本块的字符长度,影响召回粒度和模型处理效率
overlap_size150-250 字符文本块之间的重叠字符数,有助于保持上下文连贯性

这两者互相约束的地方

召回条数与每段文本长度的乘积,其总 token 量必须控制在模型的上下文预算之内。引用上限是按 token 计数的,而向量库返回的是独立的段落条数,谁先达到限制取决于每个段落的实际 token 长度。如果每个段落较短,可能会先达到引用上限的 token 限制,而条数可能还未触及上限;如果段落较长,则可能在条数较少时就达到了 token 限制。openGauss 索引参数 ef_construction 和 ef_search 调大后,向量检索的准确性会提高,可能返回更相关的少量高质量段落,这有助于在引用上限内提供更精准的信息,避免因大量冗余内容挤占模型上下文。

容易做错的三处

  • 日志显示 400 Bad Request: Context window exceeded。原因是在检索结果和用户输入一起送给模型时,总 token 数超过了 8000。
  • 检索结果返回的文档片段数量远低于预期,但内容很长。原因可能是 chunk_size 设置过大,单个文档块占用 token 过多,导致在引用上限内只能返回少量片段。
  • 模型回答内容缺乏相关性,尽管向量库返回了多条结果。原因可能是 ef_search 设置过低,导致向量检索的精度不足,返回的虽然是多条,但实际相关性不强。

怎么确认配好了

  • 在 FastGPT 界面发起测试对话,观察模型回答是否流畅,没有因上下文不足而中断。合格阈值应根据实际业务场景的平均问答长度和引用需求确定。
  • 检查 FastGPT 后台的日志输出,确认没有出现 Context window exceeded 错误。合格阈值是零此类错误。
  • 通过 FastGPT 的 RAG 调试功能,查看实际召回的文档片段数量及其 token 长度,确保总长度在引用上限 8000 token 内。合格阈值是平均每次检索的引用内容 token 数不超过 7000 token。
  • 执行一系列包含长文本和短文本的查询,验证 openGauss 能够稳定返回相关结果,并且返回的段落数量和内容长度符合预期。

参考资料