这一档模型的参数意味着什么
这一档模型具备 204000 token 的上下文长度,决定了在单次交互中能处理的最大输入信息量,包括用户提问、历史对话以及召回内容。单次最大输出虽未明确标注,但通常支持较长的回答。引用上限为 200000 token,这是 FastGPT 用于承载检索内容的预算。引用内容的 token 预算限制的是引用内容合计占用的 token 数量。段落条数由检索侧的返回条数决定,两者是不同的量。模型支持工具调用,可以集成外部功能,但不支持图片输入,无法处理视觉信息。
配 Milvus 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
MILVUS_ADDRESS | your_milvus_host:19530 | 连接 Milvus 服务的标准地址与端口,确保网络可达 |
MILVUS_TOKEN | 按实测标定 | Milvus 身份验证令牌,保证连接安全与权限 |
index_type | HNSW | 适用于高维向量高效近似最近邻搜索,平衡查询速度与精度 |
metric_type | IP | 内积距离计算,适用于需要衡量向量相似度且值域有意义的场景 |
recall_k | 32 | Milvus 检索返回的向量数量,影响后续召回段落的丰富度 |
segment_max_tokens | 800-1200 字符 | 单个文本段落的最大字符长度,结合模型引用上限估算 |
这两者互相约束的地方
召回条数与每段长度的乘积不能超过这一档模型的上下文预算。引用上限按 token 计,向量库返回的按条数计,因此谁先触顶取决于每段文本的实际 token 长度。例如,如果每段文本较短,则可以召回更多条数;如果每段文本较长,则召回条数会相应减少以避免超出引用上限。Milvus 的索引参数,如 HNSW 的 M 和 efConstruction,调大后可以提升检索精度和召回率,这对于利用 MiniMax 204K 上下文模型的长上下文能力至关重要。更精准的召回能够为模型提供更相关的上下文,进而生成更高质量的回复。
容易做错的三处
- 日志显示
Connection refused或Authentication failed:Milvus 地址MILVUS_ADDRESS或MILVUS_TOKEN配置错误。 - 界面提示“引用内容过长”:召回条数过多或单段文本
segment_max_tokens过长,导致超出模型的quoteMaxToken。 - 返回结果中引用内容为空或不相关:Milvus 检索参数
recall_k设置过低,或索引metric_type不适用于当前数据。
怎么确认配好了
- 在 FastGPT 知识库管理页面,尝试导入文档并观察是否成功切片并送入 Milvus,检查 Milvus 监控指标确认向量写入量。
- 通过 FastGPT 的调试功能,输入测试问题并查看模型返回的引用内容,评估其相关性与数量是否符合预期。
- 调整
recall_k参数,观察 FastGPT 调试界面中引用的段落数量变化,确保在quoteMaxToken预算内能有效召回。