这一档模型的参数意味着什么
MiniMax 196K 上下文模型,其上下文长度高达 196000 token,这意味着在单次对话中,模型可以处理极大量的输入信息,为复杂的问答和推理场景提供了充足的空间。引用上限为 190000 token,明确了模型用于引用召回内容的预算。召回内容的总 token 数量应控制在此预算内。工具调用能力表明模型可以与外部系统进行交互,执行特定任务,扩展了其应用边界。图片输入功能未开启,表明该模型主要处理文本信息。
配 Milvus 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
MILVUS_ADDRESS | localhost:19530 | Milvus 服务默认端口和地址,按实际部署调整 |
MILVUS_TOKEN | YOUR_MILVUS_TOKEN | Milvus 访问凭证,保障连接安全 |
index_type | HNSW | HNSW 索引在召回效率和精度上表现均衡,适合大规模向量搜索 |
metric_type | IP | IP(内积)距离度量适用于文本嵌入向量的相似度计算 |
search_k | 32 | 搜索时邻居节点数量,影响召回精度,可根据实际效果微调 |
recall_top_k | 前 10 条 | 向量库返回的文档条数上限,平衡召回量与模型上下文处理能力 |
这两者互相约束的地方
MiniMax 196K 上下文模型的上下文长度是 196000 token,其中引用上限为 190000 token。向量库返回的召回条数与每段文档的平均长度共同决定了引用内容的总体 token 消耗。如果向量库返回的文档条数过多,或者每段文档的长度过长,可能会超出模型的引用上限。引用上限是引用内容总 token 的预算,而向量库返回的是文档条数。引用内容的总 token 数量取决于召回的文档条数与每条文档的平均 token 长度。
当 Milvus 的索引参数,如 search_k 调大时,向量搜索的精度和召回率可能提高,意味着模型能获取更全面、更相关的上下文信息。这有助于 MiniMax 模型在复杂场景下生成更准确、更丰富的回答。然而,更高的召回率也可能带来更多的文档条数或更长的文档内容,需要确保总 token 量仍在模型的引用上限 190000 token 范围内。
容易做错的三处
- 现象:FastGPT 日志显示
context_exceed_limit错误。原因:向量库召回内容总 token 超过了模型引用上限。 - 现象:查询结果相关性差,但 Milvus 容器 CPU 占用率高。原因:
search_k参数过低,导致召回精度不足,或metric_type不匹配数据类型。 - 现象:FastGPT 检索时报
Milvus connection failed。原因:MILVUS_ADDRESS或MILVUS_TOKEN配置错误,无法连接到 Milvus 服务。
怎么确认配好了
- 在 FastGPT 界面进行一次包含大量上下文的测试查询,观察响应速度和相关性,并检查 FastGPT 日志中是否有
context_exceed_limit错误。 - 通过 Milvus 客户端工具查询,验证
HNSW索引的召回精度,并比对期望的相似度结果。 - 在 Milvus 监控面板观察
query_latency和qps指标,确保其在可接受范围内。 - 调整测试查询的召回条数和每段长度,观察模型响应的引用内容 token 消耗,确保其保持在 190000 token 引用上限之下。