模型指南官方文档4 分钟阅读模型组合页

OpenAI 200K 上下文 这一档模型配 Milvus 的配置口径

OpenAI 这一档模型(`o4-mini`、`o3`)具备 200000 的上下文长度,这意味着在单次对话中模型可以处理极长的输入序列,为复杂的RAG场景提供了充足的空间。引用上限为 120000 token,这部分预算专用于承载从知识库检索到的内容,确保模型在生成回答时有足够的背景信息。检索到的

这一档模型的参数意味着什么

OpenAI 这一档模型(o4-mini、o3)具备 200000 的上下文长度,这意味着在单次对话中模型可以处理极长的输入序列,为复杂的RAG场景提供了充足的空间。引用上限为 120000 token,这部分预算专用于承载从知识库检索到的内容,确保模型在生成回答时有足够的背景信息。检索到的段落条数与引用内容的总 token 预算独立,模型会综合考量两者。图片输入能力允许模型处理多模态信息,拓宽了应用场景。工具调用能力则使得模型能够与外部系统交互,执行特定任务。

配 Milvus 要定哪些

配置项建议取法这样取的依据
MILVUS_ADDRESSlocalhost:19530 或 your_milvus_host:19530指定 Milvus 服务端的网络地址和端口,确保 FastGPT 能正确连接。
MILVUS_TOKENyour_api_key若 Milvus 服务开启了认证,此令牌用于授权访问,保障数据安全。
HNSW (索引类型)HNSWHNSW 索引在召回性能和精确度之间提供了良好平衡,适合多数 RAG 场景。
IP (距离度量)IP内积距离(Inner Product)适用于计算向量相似度,尤其在嵌入向量归一化后。
efConstruction (HNSW 参数)128控制 HNSW 索引构建时的图拓扑,影响索引速度和召回质量,通常取值范围为 64-512。
ef (HNSW 参数)64控制 HNSW 搜索时的图遍历深度,影响召回精度和查询延迟,通常取值范围为 32-256。

这两者互相约束的地方

对于上下文长度为 200000 token 的模型,结合 Milvus 进行 RAG 时,需确保向量库召回的总内容量在模型的处理能力范围内。引用上限为 120000 token,这部分预算用于承载所有检索到的引用内容。向量库返回的是固定数量的段落,而引用上限是按 token 计数的。当每段内容的 token 数量较大时,引用上限可能会比预期的段落条数更早触及;反之,若每段内容较短,则向量库的返回条数可能先达到上限。索引参数如 efConstruction 和 ef 调大,通常会提升 Milvus 的召回精度,这意味着模型能够获取更相关的上下文信息,从而可能生成更准确、更丰富的回答。

容易做错的三处

  • 日志中出现 Milvus connection failed: [Errno 111] Connection refused 错误:MILVUS_ADDRESS 配置不正确或 Milvus 服务未启动。
  • 检索结果列表为空,但知识库中明明有数据:MILVUS_TOKEN 未设置或不正确,导致认证失败无法查询。
  • RAG 模式下模型回答内容空泛或不相关:召回的向量段落长度过短或索引参数 ef 设置过低,导致召回质量不佳。

怎么确认配好了

  • 检查 FastGPT 系统日志,确认没有 Milvus 相关的连接错误信息。
  • 在 FastGPT 知识库管理界面,上传少量文档后,尝试进行一次检索测试,观察是否能正常返回结果。
  • 调整 Milvus 索引参数后,通过对比不同参数下的检索结果相关性来评估配置效果,并依据业务场景设定合格阈值。

参考资料