模型指南官方文档4 分钟阅读模型组合页

AntLing 64K 上下文 这一档模型配 openGauss 的配置口径

AntLing `Ring-mini-2.0` 模型提供 64000 的上下文长度,这意味着在单次交互中,模型能够处理的总输入信息(包括用户查询、系统指令以及检索到的内容)高达 64000 token。引用上限 60000 token 专门用于检索内容的预算,它限定了从知识库中召回并送入模型进行引用

这一档模型的参数意味着什么

AntLing Ring-mini-2.0 模型提供 64000 的上下文长度,这意味着在单次交互中,模型能够处理的总输入信息(包括用户查询、系统指令以及检索到的内容)高达 64000 token。引用上限 60000 token 专门用于检索内容的预算,它限定了从知识库中召回并送入模型进行引用的内容总量。单次最大输出未标注,表示回答长度由模型自身生成能力决定,不受硬性限制。此外,该档模型不支持图片输入和工具调用,因此基于这些能力的链路无法启用。

配 openGauss 要定哪些

配置项建议取法这样取的依据
OPENGAUSS_URLjdbc:opengauss://<host>:<port>/<database>连接 openGauss 实例的标准化 JDBC URL 格式
ef_construction100影响索引构建时的邻居搜索质量,数值越大构建时间越长但召回准确率越高
ef_search60影响查询时的邻居搜索质量,数值越大搜索时间越长但召回准确率越高
m32HNSW 图的每层最大邻居数,影响索引结构紧密程度和查询性能
recall_top_k5每次检索操作从 openGauss 返回的向量条目数量,结合引用上限进行调整
chunk_size800 字符知识库文本切分时每个块的字符数,直接影响单条召回内容的长度

这两者互相约束的地方

模型 64000 token 的上下文长度是总输入预算,其中 60000 token 专用于引用内容。openGauss 向量库返回的是条数,每条内容携带的 token 数量取决于知识库切片时的 chunk_size 配置。召回条数与每条内容的 token 数之积必须控制在 60000 token 引用预算内。如果 chunk_size 较大,即使召回条数不多,也可能迅速触及引用上限。反之,chunk_size 较小,则可以召回更多条内容。openGauss 的 ef_construction 和 ef_search 参数调大,意味着索引构建和查询时会进行更详尽的邻居搜索,提高召回准确率,但也可能增加 openGauss 实例的计算负担和响应延迟。这些因素需要综合考量,以确保在模型引用预算内获取高质量的召回内容。

容易做错的三处

  • 日志中出现 Context window exceeded 错误:原因在于检索到的内容加上用户查询和系统指令,总 token 数超过了 64000 的上下文长度。
  • 界面显示回答内容与检索结果关联性低:原因可能是 ef_search 设置过低,导致 openGauss 在查询时未能有效召回最相关的向量。
  • 检索结果返回的条目数远少于预期:原因可能是 recall_top_k 参数设置不当,或 openGauss 索引的数据量不足以满足期望的返回数量。

怎么确认配好了

  • 在 FastGPT 平台配置知识库后,通过「调试」功能观察召回内容的总 token 数,确保其在 60000 引用上限内。
  • 执行多次不同主题的问答,检查模型回答中对引用内容的准确性和相关性,以此评估 openGauss 的召回质量。
  • 监控 openGauss 实例的 CPU 和内存使用率,确认 ef_construction 和 ef_search 参数调整后,系统资源消耗在可接受范围内。
  • 检查 FastGPT 系统日志,确认没有出现与 openGauss 连接或查询相关的异常报错信息。

参考资料