模型指南官方文档4 分钟阅读模型组合页

OpenAI 200K 上下文 这一档模型配 Milvus 的配置口径

`o3-mini` 模型档位具备 200000 的上下文长度,这意味着单次交互中可处理的输入信息总量极其庞大。引用上限 `quoteMaxToken` 为 120000,这明确了模型在生成回复时,可用于参考的检索内容所能占据的 token 预算。引用内容的合计 token 数将直接受此限制。单次最大

这一档模型的参数意味着什么

o3-mini 模型档位具备 200000 的上下文长度,这意味着单次交互中可处理的输入信息总量极其庞大。引用上限 quoteMaxToken 为 120000,这明确了模型在生成回复时,可用于参考的检索内容所能占据的 token 预算。引用内容的合计 token 数将直接受此限制。单次最大输出未标注,通常表示模型在输出长度上具有较大弹性,但仍受制于总上下文限制。工具调用能力为 true,允许模型与外部工具进行交互以完成复杂任务。图片输入为 false,表明此模型版本不直接支持图像作为输入。

配 Milvus 要定哪些

配置项建议取法这样取的依据
MILVUS_ADDRESSmilvus-cluster:19530生产环境 Milvus 服务地址,确保 FastGPT 可达
MILVUS_TOKENyour_api_tokenMilvus Cloud 或启用认证的 Milvus 集群访问凭证
HNSW 参数 ef64-128提高召回精度,兼顾查询延迟
HNSW 参数 M16-32控制图结构的连接度,影响索引大小和召回质量
检索条数前 5 条匹配多数 RAG 场景的召回效率与相关性平衡
段落长度800-1200 字符确保每段信息完整,减少语义碎片

这两者互相约束的地方

模型上下文预算与向量库召回内容之间存在直接制约。200000 的上下文长度为模型处理大规模信息提供了基础,但并非所有召回内容都能被利用。引用上限 quoteMaxToken 为 120000,这是模型实际能“阅读”的引用内容总和。向量库返回的检索结果以条数计,而模型引用内容以 token 计。当每段召回内容的平均 token 数较高时,即使返回的条数不多,也可能迅速触及引用上限。反之,如果每段内容较短,可以在引用上限内包含更多条目。Milvus 的索引参数,例如 HNSW 的 ef 和 M,调大通常能提升召回精度和效率。当向量召回更精准时,少量高质量的召回条目就能满足模型需求,从而在引用上限内实现更有效的知识利用,避免无效信息占用上下文。

容易做错的三处

  • 现象:RAG 模式下模型回复内容简短且缺乏相关性。原因:Milvus 检索返回的条数过少或向量索引 HNSW 参数 ef 设置过低,导致召回质量不佳。
  • 现象:FastGPT 日志显示 context_length_exceeded 错误。原因:向量库返回的检索内容总 token 数超出了模型的引用上限 quoteMaxToken。
  • 现象:模型调用工具后返回结果不符合预期。原因:Milvus 存储的工具描述或相关文档不完整,导致模型理解工具功能存在偏差。

怎么确认配好了

  • 通过 FastGPT 提供的调试界面,观察每次 RAG 查询的实际召回条数和总 token 占用,确保在引用上限 quoteMaxToken 内且召回条数符合预期。
  • 对比 FastGPT 的问答结果与 Milvus 召回内容,验证模型是否有效利用了召回信息,并据此调整 Milvus 的 HNSW 索引参数,例如 M 和 ef,以优化相关性。
  • 运行一组标准测试用例,记录模型在不同 Milvus 配置下的回复质量和延迟,根据业务需求设定合格的性能阈值。
  • 检查 FastGPT 系统日志,确认没有出现 MILVUS_ADDRESS 连接失败或 MILVUS_TOKEN 认证失败的错误信息。

参考资料