模型指南官方文档4 分钟阅读模型组合页

MistralAI 256K 上下文 这一档模型配 OceanBase 的配置口径

MistralAI 这一档模型,包含 `mistral-large-2512`、`mistral-small-2603`、`mistral-medium-3-5`。其 256000 的上下文长度,意味着单次请求可以承载极大量的输入内容,为复杂的知识召回和多轮对话提供了充足空间。未标注的单次最大输出,

这一档模型的参数意味着什么

MistralAI 这一档模型,包含 mistral-large-2512、mistral-small-2603、mistral-medium-3-5。其 256000 的上下文长度,意味着单次请求可以承载极大量的输入内容,为复杂的知识召回和多轮对话提供了充足空间。未标注的单次最大输出,通常提示模型可以生成较长的回答,具体长度受限于整体上下文预算。240000 的引用上限,表明模型可以处理并引用大量的知识片段,支持深度知识问答。图片输入和工具调用能力则扩展了模型的应用边界,使其能够处理多模态信息并与外部系统交互。

配 OceanBase 要定哪些

配置项建议取法这样取的依据
OCEANBASE_URLmysql://user:password@host:port/databaseFastGPT 连接 OceanBase 的标准 MySQL 协议连接字符串。
ef_construction64HNSW 索引构建参数,影响索引质量和构建速度,此值在召回质量与索引构建开销间取得平衡。
m16HNSW 索引参数,影响邻居节点数量,此值在召回性能与内存占用间取得平衡。
VECTOR_DIMENSION1024 或 1536根据模型输出向量维度设置,确保向量写入时维度匹配。
RETRIEVAL_TOP_K3-5 条初步召回的知识条目数量,避免一次性召回过多无效信息。

这两者互相约束的地方

MistralAI 这一档模型的 256K 上下文长度是核心约束。知识召回时,向量库返回的每段长度乘以召回条数,不能超过模型的总上下文预算。FastGPT 的引用上限(240000)与 OceanBase 向量库的实际返回条数(RETRIEVAL_TOP_K)存在层级关系:实际进入模型引用的条数,受限于两者中的较小值。通常,OceanBase 负责初步的向量相似度检索,返回 RETRIEVAL_TOP_K 条结果;FastGPT 会在此基础上进行二次筛选和去重,最终将不超过引用上限的内容送入模型。OceanBase 的 ef_construction 和 m 参数调大,能提升召回精度,减少误召回,这对于需要高精度知识问答的 MistralAI 模型而言,意味着更少噪声、更精准的输入。

容易做错的三处

  • 日志显示 Error: Context window exceeded:通常是召回内容总长度超过了 256000 字符。
  • 模型返回内容空泛或不相关:RETRIEVAL_TOP_K 设置过低,导致向量库召回条数不足,或 ef_construction 和 m 参数过小影响了召回质量。
  • 知识库上传或索引构建超时:OceanBase 资源不足或 ef_construction 参数设置过高,导致索引构建耗时过长。

怎么确认配好了

  • 在 FastGPT 界面上传一个长文档,观察其能否正常分段、嵌入并写入 OceanBase,并检查 OceanBase 中是否有新的向量数据。
  • 针对上传的文档,发起一个复杂且需要深度知识召回的提问,观察模型的回答是否精准且引用了文档中的信息,同时检查 FastGPT 后台的召回条数是否符合预期。
  • 通过 FastGPT 的调试界面,查看每次请求送入模型的上下文总长度,确认其未超出 256000 的限制。
  • 模拟高并发请求,观察 OceanBase 的 CPU、内存和 IO 负载,评估其在高压下的性能表现。

参考资料