模型指南官方文档5 分钟阅读模型组合页

MistralAI 32K 上下文 这一档模型配 OceanBase 的配置口径

`mistral-small-latest` 模型具备 32000 token 的上下文长度,决定了单次请求中可输入的最大文本量,包括用户查询、历史对话以及召回的知识内容。引用上限同样为 32000 token,这意味着知识库引用内容的总长度不能超过此限制。模型未标注单次最大输出,但实际应用中通常受

这一档模型的参数意味着什么

mistral-small-latest 模型具备 32000 token 的上下文长度,决定了单次请求中可输入的最大文本量,包括用户查询、历史对话以及召回的知识内容。引用上限同样为 32000 token,这意味着知识库引用内容的总长度不能超过此限制。模型未标注单次最大输出,但实际应用中通常受限于上下文总长度。该模型支持工具调用,允许其与外部功能进行交互,但不支持图片输入,因此在涉及多模态RAG场景时,需要额外处理图像信息。这些参数共同构成了模型在工程实践中的能力边界。

配 OceanBase 要定哪些

配置项建议取法这样取的依据
OCEANBASE_URLob://user:password@host:port/database连接 OceanBase 数据库的完整 URL,确保包含认证信息和数据库名,端口通常为 2881。
ef_construction100–200HNSW 索引构建参数,影响索引质量和构建时间。此范围可在保证召回效果的同时控制索引构建开销。
m16–32HNSW 索引邻居数参数,影响召回精度和查询速度。此范围能平衡召回率与查询延迟。
recall_top_k5–8向量检索返回的相似度最高条目数量。根据模型上下文长度和单条文档长度调整,避免超出模型引用上限。
chunk_overlap64–128 字符文本分块时的重叠字符数,用于保持上下文连贯性,避免关键信息被切割。
embedding_model_dim1024向量模型的输出维度,需与实际使用的 embedding 模型维度匹配,例如 bge-large-zh-v1.5 模型的维度。

这两者互相约束的地方

mistral-small-latest 模型 32000 token 的上下文长度对知识召回提出了明确要求。召回条数与每条文档的平均长度之积必须严格控制在模型上下文预算内,以避免截断或因超出限制而导致请求失败。引用上限 32000 token 意味着知识库返回的引用内容总长度是模型可接受的上限,向量库返回的 recall_top_k 条目数与单条文档长度共同决定了最终的引用内容总量。在实际操作中,向量库的返回条数与模型引用上限两者中,先达到限制者生效。此外,OceanBase 中 HNSW 索引参数 ef_construction 和 m 的调大,通常会提升向量检索的精度,从而可能召回更相关的文档。对于模型而言,更精准的召回意味着输入质量的提升,有助于模型生成更准确、相关的回答,但同时也会增加索引构建和查询的计算成本。

容易做错的三处

  • 日志中出现 Token limit exceeded 错误,原因是召回内容总长度超过了模型 32000 token 的上下文限制。
  • 检索结果中的引用内容与用户问题关联性低,原因可能是 ef_construction 或 m 参数设置过低,导致向量索引质量不佳。
  • 查询等待时间过长,甚至出现 Connection Timeout,原因可能是 OCEANBASE_URL 配置有误或网络连接不稳定。

怎么确认配好了

  • 执行一次知识库检索,检查日志中 OceanBase 的查询耗时是否在可接受范围内。可接受范围的基线值应根据实际业务需求和硬件性能进行标定。
  • 使用 FastGPT 的调试功能,观察模型返回的引用内容是否与用户提问高度相关,并检查引用内容的总长度是否合理。合理范围应在模型上下文上限内,且避免冗余信息。
  • 尝试不同复杂度的查询,核对返回结果中的 recall_top_k 数量是否与配置相符,且内容完整无截断。

参考资料