这一档模型的参数意味着什么
Baichuan 系列的 Baichuan-M3、Baichuan-M3-Plus 和 Baichuan2-Turbo 模型,其上下文长度 maxContext 达到 32000 token,这决定了单次请求中模型可以接收和处理的输入信息总量。引用上限 quoteMaxToken 为 30000 token,这是模型用于引用内容的预算。这个引用预算是针对所有引用内容的总计 token 数。单次最大输出长度未明确标注,意味着在实际使用中需根据具体场景进行测试。这些模型不支持图片输入和工具调用,因此在使用时,应避免将图片数据作为输入,也不应尝试调用外部工具。
配 OceanBase 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OCEANBASE_URL | mysql://user:pass@host:port/database | OceanBase 基于 MySQL 协议,通过标准连接串指定服务地址与认证信息 |
ef_construction | 128 | 影响索引构建时的图连接数量,提升召回质量,避免过度计算 |
m | 16 | 控制 HNSW 索引中每个节点的最大连接数,平衡查询速度与内存占用 |
| 召回段落数 | 5-8 条 | 结合模型上下文长度与单段平均 token 数,确保引用内容在预算内 |
| 单段最大字符数 | 800-1200 字符 | 避免单段过长导致引用内容超出模型引用上限,或过短影响信息完整性 |
query_timeout | 30000 毫秒 | 确保复杂查询有足够时间完成,避免因超时中断 |
SEEKDB 作为 OceanBase 的兼容方案,在配置口径上与 OceanBase 保持一致,可沿用上述配置项。
这两者互相约束的地方
这一档模型的 32000 token 上下文长度与 30000 token 引用上限,对 OceanBase 的召回策略构成直接约束。向量库返回的段落数量乘以每段内容的 token 长度,必须控制在模型的上下文预算之内,以避免截断或溢出。引用上限是模型用于整合引用内容的预算,以 token 计量。向量库的召回结果是以条数计量的。究竟是召回条数过多导致整体 token 超标,还是单条段落过长触及引用上限,取决于实际的段落切分策略。如果 OceanBase 的索引参数,例如 ef_construction 或 m,被调大以提升召回质量,可能意味着在查询时需要消耗更多的计算资源。这可能导致查询延迟增加,进而影响整体响应时间,尤其是在高并发场景下。
容易做错的三处
- 模型返回错误码
400,并提示Context window exceeded。原因:召回内容总 token 量或单段 token 量超出了模型的上下文长度或引用上限。 - 检索结果中的
引用内容字段为空。原因:向量库未返回足够多或足够相关的段落,或者召回的段落因长度限制被完全过滤。 - 查询响应时间显著增加,甚至出现
Connection timed out。原因:OceanBase 索引参数设置过高,导致查询计算量过大,或网络延迟过高。
怎么确认配好了
- 通过 FastGPT 的调试界面,观察每次查询后
引用内容区域是否稳定填充相关信息,且无截断提示。 - 在 FastGPT 的日志中,检查是否存在
Context window exceeded或类似的模型错误提示,确保模型运行稳定。 - 监控 OceanBase 的查询响应时间,确保在预期范围内,并与
query_timeout配置相匹配。 - 验证不同查询条件下,向量召回的段落数量和内容质量是否符合预期,并根据实际效果调整
ef_construction和m等索引参数。