模型指南官方文档5 分钟阅读模型组合页

AntLing 256K 上下文 这一档模型配 OceanBase 的配置口径

AntLing 256K 上下文模型系列,其上下文长度 `maxContext` 达到 256000 token,决定了单次请求中模型可以处理的最大输入信息量,包括用户查询、历史对话和召回内容。引用上限 `quoteMaxToken` 为 240000 token,这意味着在生成回复时,可用于引用外

这一档模型的参数意味着什么

AntLing 256K 上下文模型系列,其上下文长度 maxContext 达到 256000 token,决定了单次请求中模型可以处理的最大输入信息量,包括用户查询、历史对话和召回内容。引用上限 quoteMaxToken 为 240000 token,这意味着在生成回复时,可用于引用外部知识的 token 总量限制在此范围内。引用内容的总 token 量是模型在生成回复时引用的依据。段落条数由检索侧返回,决定了可供模型选择的知识片段数量。工具调用 true 表示模型支持通过外部工具扩展其能力,允许执行特定操作或获取实时信息。图片输入 false 表明模型不直接接受图像作为输入。

配 OceanBase 要定哪些

配置项建议取法这样取的依据
OCEANBASE_URLjdbc:mysql://[host]:[port]/[database]指定 OceanBase 数据库的连接地址和端口,确保 FastGPT 可以访问。
ef_construction64HNSW 索引构建参数,影响索引质量和构建速度,此值在性能与召回率之间取得平衡。
m16HNSW 索引参数,控制每个节点的最大连接数,影响召回精度和查询延迟。
recall_top_k3-5向量检索时返回的相似度最高条数,结合引用上限与单段长度优化。
chunk_overlap50-100 字符分段时相邻文本块的重叠部分,有助于保留上下文连贯性。
max_chunk_size800-1200 字符单个文本块的最大长度,避免单个块过大导致引用效率降低。

这两者互相约束的地方

AntLing 256K 上下文模型处理的最大输入信息量受限于 256000 token。当从 OceanBase 检索到内容时,召回的条数乘以每段的平均长度,其总和不能超出这个上下文预算。引用上限 240000 token 是对引用内容总 token 量的约束,而 OceanBase 返回的是具体知识片段的条数。因此,是总引用 token 量先触及上限,还是召回条数先达到模型处理的上限,取决于每个知识片段的平均 token 长度。如果每个片段较短,可能会召回更多条数才达到 token 上限;如果片段较长,则较少条数即可触及 token 上限。OceanBase 的 ef_construction 和 m 等索引参数调大后,通常会提高检索的准确性和召回率,意味着模型能够获得更相关、更丰富的背景信息,这有助于在 240000 token 的引用上限内填充更高质量的内容。

容易做错的三处

  • 在 FastGPT 界面配置 OceanBase 时,连接测试失败,显示 Error: Access denied for user。原因:OCEANBASE_URL 中提供的数据库用户或密码不正确,或数据库权限不足。
  • 模型回答内容无法引用任何知识库内容,日志中显示 Quote content exceeds token limit。原因:召回的知识片段总 token 量超出了 quoteMaxToken 的限制,模型无法将所有召回内容纳入引用范围。
  • 检索结果条数与预期不符,或检索耗时过长。原因:OceanBase 的 ef_construction 或 m 参数设置不当,导致索引效率低下或召回策略不优化。

怎么确认配好了

  • 在 FastGPT 知识库管理页面,尝试添加 OceanBase 数据源,并点击连接测试按钮,确保返回“连接成功”状态。
  • 上传文档到知识库后,通过知识库的“测试检索”功能,输入测试问题,检查返回的召回条数和内容相关性,并观察日志中是否有关于 token 限制的警告。
  • 使用 FastGPT 的调试功能,在模型请求中观察 quoteMaxToken 字段的实际消耗情况,确保其在 240000 token 的限制内,并根据实际业务场景评估召回条数和引用内容的匹配度。
  • 在 FastGPT 的日志输出中,检查是否存在 OceanBase 相关的错误或警告信息,特别是关于查询超时或索引性能的提示。

参考资料