这一档模型的参数意味着什么
OpenAI 这一档模型(o4-mini、o3)具备 200000 的上下文长度,这意味着在单次对话中模型可以处理极长的输入序列,为复杂的RAG场景提供了充足的空间。引用上限为 120000 token,这部分预算专用于承载从知识库检索到的内容,确保模型在生成回答时有足够的背景信息。检索到的段落条数与引用内容的总 token 预算独立,模型会综合考量两者。图片输入能力允许模型处理多模态信息,拓宽了应用场景。工具调用能力则使得模型能够与外部系统交互,执行特定任务。
配 Milvus 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
MILVUS_ADDRESS | localhost:19530 或 your_milvus_host:19530 | 指定 Milvus 服务端的网络地址和端口,确保 FastGPT 能正确连接。 |
MILVUS_TOKEN | your_api_key | 若 Milvus 服务开启了认证,此令牌用于授权访问,保障数据安全。 |
HNSW (索引类型) | HNSW | HNSW 索引在召回性能和精确度之间提供了良好平衡,适合多数 RAG 场景。 |
IP (距离度量) | IP | 内积距离(Inner Product)适用于计算向量相似度,尤其在嵌入向量归一化后。 |
efConstruction (HNSW 参数) | 128 | 控制 HNSW 索引构建时的图拓扑,影响索引速度和召回质量,通常取值范围为 64-512。 |
ef (HNSW 参数) | 64 | 控制 HNSW 搜索时的图遍历深度,影响召回精度和查询延迟,通常取值范围为 32-256。 |
这两者互相约束的地方
对于上下文长度为 200000 token 的模型,结合 Milvus 进行 RAG 时,需确保向量库召回的总内容量在模型的处理能力范围内。引用上限为 120000 token,这部分预算用于承载所有检索到的引用内容。向量库返回的是固定数量的段落,而引用上限是按 token 计数的。当每段内容的 token 数量较大时,引用上限可能会比预期的段落条数更早触及;反之,若每段内容较短,则向量库的返回条数可能先达到上限。索引参数如 efConstruction 和 ef 调大,通常会提升 Milvus 的召回精度,这意味着模型能够获取更相关的上下文信息,从而可能生成更准确、更丰富的回答。
容易做错的三处
- 日志中出现
Milvus connection failed: [Errno 111] Connection refused错误:MILVUS_ADDRESS配置不正确或 Milvus 服务未启动。 - 检索结果列表为空,但知识库中明明有数据:
MILVUS_TOKEN未设置或不正确,导致认证失败无法查询。 - RAG 模式下模型回答内容空泛或不相关:召回的向量段落长度过短或索引参数
ef设置过低,导致召回质量不佳。
怎么确认配好了
- 检查 FastGPT 系统日志,确认没有 Milvus 相关的连接错误信息。
- 在 FastGPT 知识库管理界面,上传少量文档后,尝试进行一次检索测试,观察是否能正常返回结果。
- 调整 Milvus 索引参数后,通过对比不同参数下的检索结果相关性来评估配置效果,并依据业务场景设定合格阈值。