模型指南官方文档4 分钟阅读模型组合页

Baichuan 128K 上下文 这一档模型配 OceanBase 的配置口径

`Baichuan3-Turbo-128k` 模型具备 128000 的上下文长度,这意味着在单次对话中,模型可以处理的输入总长度达到 128k token,足以容纳大量召回内容。引用上限为 100000 token,这笔预算专门用于模型在生成回答时所引用的外部知识内容。召回的段落总 token 数

这一档模型的参数意味着什么

Baichuan3-Turbo-128k 模型具备 128000 的上下文长度,这意味着在单次对话中,模型可以处理的输入总长度达到 128k token,足以容纳大量召回内容。引用上限为 100000 token,这笔预算专门用于模型在生成回答时所引用的外部知识内容。召回的段落总 token 数应控制在此预算内。工具调用功能的存在,允许模型在需要时通过外部工具获取信息或执行操作,扩展了其处理复杂任务的能力。图片输入为 false,表明模型不直接支持视觉信息的处理。

配 OceanBase 要定哪些

配置项建议取法这样取的依据
OCEANBASE_URLob://user:password@host:port/database数据库连接的规范格式,确保 FastGPT 可以正确连接。
ef_construction100影响 HNSW 索引构建时的图连接度,数值越大,索引质量越高,召回准确率提升。
m16影响 HNSW 索引图中每个节点的最大邻居数,数值越大,搜索精度可能提升,但索引大小和搜索时间也会增加。
召回条数5-10 条在引用上限内,兼顾召回的广度与模型处理效率,避免不必要的 token 消耗。
单段最大长度1500 字符控制每条召回内容的粒度,确保单段信息完整且不过长,便于模型理解。

这两者互相约束的地方

Baichuan3-Turbo-128k 模型的 128000 上下文长度是总预算,其中 100000 token 专门用于引用内容。这意味着向量库召回的段落总长度,加上用户查询和系统指令的长度,必须控制在 128000 token 以内。引用上限是按 token 计数的,而向量库返回的是按条数计数的。如果每条召回的段落较短,则可以返回更多条;如果每条段落较长,则在达到引用上限前,返回的条数会相对较少。OceanBase 的 ef_construction 和 m 等索引参数调大后,召回的准确性会提高,模型获得更相关的上下文,从而可能生成更精准的回答,但同时也可能增加向量检索的时间开销。

容易做错的三处

  • 调用模型时出现 "Context window exceeded" 错误:通常是由于召回内容、用户问题和系统指令的总 token 数超过了 128000 的上下文长度限制。
  • 模型回答内容缺乏相关性或不完整:可能是向量库的 ef_construction 或 m 参数设置过低,导致召回的段落质量不高或不够全面。
  • 向量检索耗时过长,影响用户体验:频繁的复杂查询或过大的 ef_construction 值,可能导致 OceanBase 在检索时性能下降。

怎么确认配好了

  • 在 FastGPT 知识库管理界面,调整单段最大长度和召回条数,观察模型回答的质量和引用内容是否完整。
  • 通过 FastGPT 的调试功能,查看模型实际接收到的引用内容 token 数,确认其未超出 100000 的引用上限。
  • 监控 OceanBase 数据库的查询日志和性能指标,确保向量检索响应时间在可接受范围内。

参考资料