模型指南官方文档5 分钟阅读模型组合页

Baichuan 32K 上下文 这一档模型配 OceanBase 的配置口径

Baichuan 系列的 Baichuan-M3、Baichuan-M3-Plus 和 Baichuan2-Turbo 模型,其上下文长度 `maxContext` 达到 32000 token,这决定了单次请求中模型可以接收和处理的输入信息总量。引用上限 `quoteMaxToken` 为 300

这一档模型的参数意味着什么

Baichuan 系列的 Baichuan-M3、Baichuan-M3-Plus 和 Baichuan2-Turbo 模型,其上下文长度 maxContext 达到 32000 token,这决定了单次请求中模型可以接收和处理的输入信息总量。引用上限 quoteMaxToken 为 30000 token,这是模型用于引用内容的预算。这个引用预算是针对所有引用内容的总计 token 数。单次最大输出长度未明确标注,意味着在实际使用中需根据具体场景进行测试。这些模型不支持图片输入和工具调用,因此在使用时,应避免将图片数据作为输入,也不应尝试调用外部工具。

配 OceanBase 要定哪些

配置项建议取法这样取的依据
OCEANBASE_URLmysql://user:pass@host:port/databaseOceanBase 基于 MySQL 协议,通过标准连接串指定服务地址与认证信息
ef_construction128影响索引构建时的图连接数量,提升召回质量,避免过度计算
m16控制 HNSW 索引中每个节点的最大连接数,平衡查询速度与内存占用
召回段落数5-8 条结合模型上下文长度与单段平均 token 数,确保引用内容在预算内
单段最大字符数800-1200 字符避免单段过长导致引用内容超出模型引用上限,或过短影响信息完整性
query_timeout30000 毫秒确保复杂查询有足够时间完成,避免因超时中断

SEEKDB 作为 OceanBase 的兼容方案,在配置口径上与 OceanBase 保持一致,可沿用上述配置项。

这两者互相约束的地方

这一档模型的 32000 token 上下文长度与 30000 token 引用上限,对 OceanBase 的召回策略构成直接约束。向量库返回的段落数量乘以每段内容的 token 长度,必须控制在模型的上下文预算之内,以避免截断或溢出。引用上限是模型用于整合引用内容的预算,以 token 计量。向量库的召回结果是以条数计量的。究竟是召回条数过多导致整体 token 超标,还是单条段落过长触及引用上限,取决于实际的段落切分策略。如果 OceanBase 的索引参数,例如 ef_construction 或 m,被调大以提升召回质量,可能意味着在查询时需要消耗更多的计算资源。这可能导致查询延迟增加,进而影响整体响应时间,尤其是在高并发场景下。

容易做错的三处

  • 模型返回错误码 400,并提示 Context window exceeded。原因:召回内容总 token 量或单段 token 量超出了模型的上下文长度或引用上限。
  • 检索结果中的 引用内容 字段为空。原因:向量库未返回足够多或足够相关的段落,或者召回的段落因长度限制被完全过滤。
  • 查询响应时间显著增加,甚至出现 Connection timed out。原因:OceanBase 索引参数设置过高,导致查询计算量过大,或网络延迟过高。

怎么确认配好了

  • 通过 FastGPT 的调试界面,观察每次查询后 引用内容 区域是否稳定填充相关信息,且无截断提示。
  • 在 FastGPT 的日志中,检查是否存在 Context window exceeded 或类似的模型错误提示,确保模型运行稳定。
  • 监控 OceanBase 的查询响应时间,确保在预期范围内,并与 query_timeout 配置相匹配。
  • 验证不同查询条件下,向量召回的段落数量和内容质量是否符合预期,并根据实际效果调整 ef_construction 和 m 等索引参数。

参考资料