模型指南官方文档4 分钟阅读模型组合页

OpenAI 128K 上下文 这一档模型配 Milvus 的配置口径

OpenAI 128K 上下文模型(如 `gpt-5.2-chat-latest`)拥有 128000 Token 的上下文窗口,这决定了单次请求中可以包含的指令、历史对话和召回知识的总量。引用上限 128000 表明理论上可以引用大量知识段落,但实际召回条数受限于上下文窗口。图片输入能力允许模型处

这一档模型的参数意味着什么

OpenAI 128K 上下文模型(如 gpt-5.2-chat-latest)拥有 128000 Token 的上下文窗口,这决定了单次请求中可以包含的指令、历史对话和召回知识的总量。引用上限 128000 表明理论上可以引用大量知识段落,但实际召回条数受限于上下文窗口。图片输入能力允许模型处理图像信息,而工具调用则支持模型与外部系统进行交互,执行特定任务,扩展了其应用场景。这些特性共同构成了模型在复杂 RAG 应用中的基础能力边界。

配 Milvus 要定哪些

配置项建议取法这样取的依据
MILVUS_ADDRESSmilvus.svc.cluster.local:19530 或 your_milvus_host:19530指向 Milvus 服务的具体网络位置,确保 FastGPT 能够连接。
MILVUS_TOKEN按实际部署设定,如 root:milvusMilvus 认证凭证,保障访问安全。
index_type for HNSWHNSWHNSW 在高维向量搜索中表现均衡,兼顾召回率与查询速度。
metric_type for HNSWIPIP (Inner Product) 距离适用于衡量向量间的相似度,与 OpenAI 模型嵌入向量的特性匹配。
hnsw_m32HNSW 参数,影响图的连接度,平衡内存占用与搜索精度。
hnsw_efConstruction200HNSW 参数,影响索引构建时的邻居搜索范围,决定构建速度与索引质量。

这两者互相约束的地方

模型 128K 的上下文窗口是核心约束。召回条数与每段知识的平均长度乘积,必须远小于 128000 Token,以预留足够的空间给指令、历史对话和模型生成内容。即使引用上限高达 128000,实际能引用的段落数量仍受限于模型的上下文窗口和单段知识的平均 Token 数。Milvus 的返回条数配置 (top_k) 与 FastGPT 知识库的召回条数共同生效,取两者中的较小值。这意味着即使 Milvus 返回大量结果,如果 FastGPT 配置的召回条数较少,模型实际接收的知识段落也会相应减少。Milvus 索引参数如 hnsw_efConstruction 调大,会提升召回精度,但可能增加索引构建时间,对于追求低延迟的应用,需要在精度和速度之间进行权衡。

容易做错的三处

  • 日志中出现 Milvus connection failed: [Errno 111] Connection refused 错误,原因是 MILVUS_ADDRESS 配置错误或 Milvus 服务未启动。
  • 模型回答中知识引用不准确或缺失,但 FastGPT 界面显示召回了大量段落,原因是召回条数过多导致单次请求 Token 超限,部分知识被截断。
  • 向量搜索响应时间过长,导致 API 请求超时,原因是 Milvus 索引参数 hnsw_ef (查询时的邻居搜索范围) 过小或硬件资源不足。

怎么确认配好了

  • 在 FastGPT 知识库中上传文档,查看 Milvus 客户端日志或监控,确认向量数据已成功写入 Milvus collection。
  • 在 FastGPT 中对知识库进行检索测试,观察返回的知识段落数量与内容,并与预期召回条数进行比对,验证 top_k 配置是否生效。
  • 通过 FastGPT 的调试界面,观察模型实际接收到的上下文 Token 数,确保召回知识与指令的总 Token 数在 128000 Token 限制内。
  • 对模型进行多轮对话测试,检查知识引用是否准确,响应速度是否符合预期,确认整体 RAG 流程顺畅。

参考资料