这一档模型的参数意味着什么
MistralAI 这一档模型,包含 mistral-large-2512、mistral-small-2603、mistral-medium-3-5。其 256000 的上下文长度,意味着单次请求可以承载极大量的输入内容,为复杂的知识召回和多轮对话提供了充足空间。未标注的单次最大输出,通常提示模型可以生成较长的回答,具体长度受限于整体上下文预算。240000 的引用上限,表明模型可以处理并引用大量的知识片段,支持深度知识问答。图片输入和工具调用能力则扩展了模型的应用边界,使其能够处理多模态信息并与外部系统交互。
配 OceanBase 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OCEANBASE_URL | mysql://user:password@host:port/database | FastGPT 连接 OceanBase 的标准 MySQL 协议连接字符串。 |
ef_construction | 64 | HNSW 索引构建参数,影响索引质量和构建速度,此值在召回质量与索引构建开销间取得平衡。 |
m | 16 | HNSW 索引参数,影响邻居节点数量,此值在召回性能与内存占用间取得平衡。 |
VECTOR_DIMENSION | 1024 或 1536 | 根据模型输出向量维度设置,确保向量写入时维度匹配。 |
RETRIEVAL_TOP_K | 3-5 条 | 初步召回的知识条目数量,避免一次性召回过多无效信息。 |
这两者互相约束的地方
MistralAI 这一档模型的 256K 上下文长度是核心约束。知识召回时,向量库返回的每段长度乘以召回条数,不能超过模型的总上下文预算。FastGPT 的引用上限(240000)与 OceanBase 向量库的实际返回条数(RETRIEVAL_TOP_K)存在层级关系:实际进入模型引用的条数,受限于两者中的较小值。通常,OceanBase 负责初步的向量相似度检索,返回 RETRIEVAL_TOP_K 条结果;FastGPT 会在此基础上进行二次筛选和去重,最终将不超过引用上限的内容送入模型。OceanBase 的 ef_construction 和 m 参数调大,能提升召回精度,减少误召回,这对于需要高精度知识问答的 MistralAI 模型而言,意味着更少噪声、更精准的输入。
容易做错的三处
- 日志显示
Error: Context window exceeded:通常是召回内容总长度超过了 256000 字符。 - 模型返回内容空泛或不相关:
RETRIEVAL_TOP_K设置过低,导致向量库召回条数不足,或ef_construction和m参数过小影响了召回质量。 - 知识库上传或索引构建超时:OceanBase 资源不足或
ef_construction参数设置过高,导致索引构建耗时过长。
怎么确认配好了
- 在 FastGPT 界面上传一个长文档,观察其能否正常分段、嵌入并写入 OceanBase,并检查 OceanBase 中是否有新的向量数据。
- 针对上传的文档,发起一个复杂且需要深度知识召回的提问,观察模型的回答是否精准且引用了文档中的信息,同时检查 FastGPT 后台的召回条数是否符合预期。
- 通过 FastGPT 的调试界面,查看每次请求送入模型的上下文总长度,确认其未超出 256000 的限制。
- 模拟高并发请求,观察 OceanBase 的 CPU、内存和 IO 负载,评估其在高压下的性能表现。