这一档模型的参数意味着什么
mistral-small-latest 模型具备 32000 token 的上下文长度,这意味着在单次对话中,模型可以处理的输入信息总量(包括用户查询、历史对话和召回知识)上限为 32000 token。单次最大输出未标注,但通常建议控制在合理范围内以避免不必要的延迟。32000 token 的引用上限决定了从知识库中召回并送入模型的知识段落总长度的天花板。该模型支持工具调用,工程上可用于实现复杂任务编排和外部系统交互。不支持图片输入,因此无法直接处理图像信息。
配 Milvus 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
MILVUS_ADDRESS | localhost:19530 或 your_milvus_host:19530 | 连接 Milvus 服务的入口地址和端口 |
MILVUS_TOKEN | 按实测标定 | 用于 Milvus 认证的 API 密钥,保障连接安全 |
index_type | HNSW | HNSW 索引在召回性能和准确性之间取得良好平衡,适用于大多数 RAG 场景 |
metric_type | IP | IP(Inner Product)适用于衡量向量间的相似度,与多数嵌入模型兼容 |
ef (HNSW 参数) | 128 | 影响 HNSW 索引的搜索精度和速度,128 是一个推荐的初始值 |
M (HNSW 参数) | 16 | 影响 HNSW 索引的图结构,16 是一个推荐的初始值 |
这两者互相约束的地方
模型 32000 token 的上下文长度对召回策略提出了明确要求。召回条数与每段知识的平均长度之积必须显著小于 32000 token,以预留空间给用户查询、历史对话和模型生成内容。引用上限 32000 token 与向量库返回条数共同作用,实际送入模型的知识量将受两者中较小值约束。例如,即使 Milvus 返回了大量相关文档,若引用上限限制,最终只有部分文档会被送入模型。Milvus 中 HNSW 索引参数 ef 和 M 的调整,会直接影响向量召回的速度和质量。提高 ef 或 M 值可以提升召回精度,但会增加查询延迟,可能导致模型等待时间延长,进而影响整体响应速度。
容易做错的三处
- 日志中出现
Milvus connection failed: [Errno 111] Connection refused错误,原因是MILVUS_ADDRESS配置不正确或 Milvus 服务未启动。 - 召回结果中知识段落数量远少于预期,通常是向量库返回条数上限设置过低,或 FastGPT 侧的引用上限约束生效。
- RAG 流程中模型返回内容与召回知识关联度低,可能是 Milvus 的
metric_type或嵌入模型选择不当,导致向量相似度计算不准确。
怎么确认配好了
- 通过 FastGPT 界面,向知识库提问,观察模型回答中是否能有效利用知识库内容。
- 检查 FastGPT 后台日志,确认没有 Milvus 相关的连接错误或查询异常。
- 在 FastGPT 知识库管理页面,上传一份文档,确认 Milvus 中有对应的向量数据生成。
- 执行一次 FastGPT 知识库查询,确认 Milvus 能够返回预期的召回条数,并通过对比召回内容与原始文档,评估召回质量。