模型指南官方文档4 分钟阅读模型组合页

AntLing 256K 上下文 这一档模型配 openGauss 的配置口径

AntLing 256K 上下文模型档位,其 `上下文长度 256000` 决定了模型在单次交互中能处理的总文本量上限,这直接影响知识库召回内容的总字数。`引用上限 240000` 规定了模型在生成回答时可以引用的知识库段落总token量,是实际RAG应用中知识召回的硬性约束。`工具调用 true`

这一档模型的参数意味着什么

AntLing 256K 上下文模型档位,其 上下文长度 256000 决定了模型在单次交互中能处理的总文本量上限,这直接影响知识库召回内容的总字数。引用上限 240000 规定了模型在生成回答时可以引用的知识库段落总token量,是实际RAG应用中知识召回的硬性约束。工具调用 true 表明模型具备与外部工具集成的能力,支持复杂任务流程编排。图片输入 false 则说明该档模型不直接处理图像数据,图像相关的多模态应用需通过其他链路实现。

配 openGauss 要定哪些

配置项建议取法这样取的依据
OPENGAUSS_URLpostgresql://user:password@host:port/database数据库连接字符串,确保 FastGPT 能正确连接 openGauss 实例。
ef_construction128构建 HNSW 索引时的邻居数量参数,影响索引质量和构建速度。
ef_search64搜索 HNSW 索引时的邻居数量参数,影响搜索召回率和速度。
m = 3232HNSW 索引中每个节点的最大连接数,平衡索引大小与查询效率。
召回条数限制前 5–10 条结合模型引用上限和单条文档长度,避免超出模型上下文。
单条文档长度800–1200 字符根据业务内容特点和模型理解能力,平衡信息密度。

这两者互相约束的地方

AntLing 256K 上下文模型与 openGauss 向量库的结合,核心在于 召回条数 × 每段长度 必须严格控制在模型 上下文长度 256000 的预算之内。同时,模型 引用上限 240000 是一个更具体的Token限制,它与向量库返回的实际条数共同作用,两者中较低的那个限制将先生效。若 openGauss 的 ef_construction 和 ef_search 等索引参数调大,通常意味着向量搜索的精度和召回率可能提高,这将为模型提供更相关的上下文,但同时也可能增加向量检索的时间开销,需要在实际部署中进行性能测试以平衡。FastGPT 在将向量检索结果送入模型前,会根据模型上下文和引用上限进行裁剪,确保输入合规。

容易做错的三处

  • 现象:模型输出回答过短或缺失关键信息。原因:向量库 ef_search 参数设置过低,导致召回的向量不够全面,未能提供足够的上下文信息给模型。
  • 现象:日志中出现 Context window exceeded 错误。原因:向量库返回的文档总长度或总条数,在 FastGPT 聚合后超过了 AntLing 模型 256000 的上下文长度限制。
  • 现象:检索结果不相关或返回空列表。原因:OPENGAUSS_URL 配置错误,导致 FastGPT 无法连接到 openGauss 实例,无法执行向量检索操作。

怎么确认配好了

  • 执行一次 FastGPT 知识库问答,检查模型输出是否包含知识库引用,并核对引用内容是否来自 openGauss 检索结果。
  • 在 FastGPT 后台查看模型输入日志,确认传递给 AntLing 模型的上下文 Token 数未超出 256000 限制,且引用 Token 数未超出 240000 限制。
  • 监控 openGauss 数据库的查询日志和性能指标,确认向量检索请求能够正常响应,且查询延迟在可接受范围内,例如 EXPLAIN ANALYZE 语句的执行时间。

参考资料