这一档模型的参数意味着什么
o3-mini 模型档位具备 200000 的上下文长度,这意味着单次交互中可处理的输入信息总量极其庞大。引用上限 quoteMaxToken 为 120000,这明确了模型在生成回复时,可用于参考的检索内容所能占据的 token 预算。引用内容的合计 token 数将直接受此限制。单次最大输出未标注,通常表示模型在输出长度上具有较大弹性,但仍受制于总上下文限制。工具调用能力为 true,允许模型与外部工具进行交互以完成复杂任务。图片输入为 false,表明此模型版本不直接支持图像作为输入。
配 Milvus 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
MILVUS_ADDRESS | milvus-cluster:19530 | 生产环境 Milvus 服务地址,确保 FastGPT 可达 |
MILVUS_TOKEN | your_api_token | Milvus Cloud 或启用认证的 Milvus 集群访问凭证 |
HNSW 参数 ef | 64-128 | 提高召回精度,兼顾查询延迟 |
HNSW 参数 M | 16-32 | 控制图结构的连接度,影响索引大小和召回质量 |
| 检索条数 | 前 5 条 | 匹配多数 RAG 场景的召回效率与相关性平衡 |
| 段落长度 | 800-1200 字符 | 确保每段信息完整,减少语义碎片 |
这两者互相约束的地方
模型上下文预算与向量库召回内容之间存在直接制约。200000 的上下文长度为模型处理大规模信息提供了基础,但并非所有召回内容都能被利用。引用上限 quoteMaxToken 为 120000,这是模型实际能“阅读”的引用内容总和。向量库返回的检索结果以条数计,而模型引用内容以 token 计。当每段召回内容的平均 token 数较高时,即使返回的条数不多,也可能迅速触及引用上限。反之,如果每段内容较短,可以在引用上限内包含更多条目。Milvus 的索引参数,例如 HNSW 的 ef 和 M,调大通常能提升召回精度和效率。当向量召回更精准时,少量高质量的召回条目就能满足模型需求,从而在引用上限内实现更有效的知识利用,避免无效信息占用上下文。
容易做错的三处
- 现象:RAG 模式下模型回复内容简短且缺乏相关性。原因:Milvus 检索返回的条数过少或向量索引
HNSW参数ef设置过低,导致召回质量不佳。 - 现象:FastGPT 日志显示
context_length_exceeded错误。原因:向量库返回的检索内容总 token 数超出了模型的引用上限quoteMaxToken。 - 现象:模型调用工具后返回结果不符合预期。原因:Milvus 存储的工具描述或相关文档不完整,导致模型理解工具功能存在偏差。
怎么确认配好了
- 通过 FastGPT 提供的调试界面,观察每次 RAG 查询的实际召回条数和总 token 占用,确保在引用上限
quoteMaxToken内且召回条数符合预期。 - 对比 FastGPT 的问答结果与 Milvus 召回内容,验证模型是否有效利用了召回信息,并据此调整 Milvus 的
HNSW索引参数,例如M和ef,以优化相关性。 - 运行一组标准测试用例,记录模型在不同 Milvus 配置下的回复质量和延迟,根据业务需求设定合格的性能阈值。
- 检查 FastGPT 系统日志,确认没有出现
MILVUS_ADDRESS连接失败或MILVUS_TOKEN认证失败的错误信息。