这一档模型的参数意味着什么
此档模型提供 200000 token 的上下文窗口,意味着单次请求可处理大量输入信息,为复杂问答和多轮对话提供充足空间。未标注的单次最大输出通常允许模型生成较长回答。100000 token 的引用上限设定了知识库召回内容可占据的最大比例,直接影响 RAG 架构中知识召回的有效性。图片输入能力支持处理多模态信息,可用于图像理解或基于图像的问答。工具调用能力则允许模型与外部系统交互,实现更复杂的自动化流程。
配 Milvus 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
MILVUS_ADDRESS | 127.0.0.1:19530 | Milvus 服务端点,需确保网络可达性。 |
MILVUS_TOKEN | 按实际部署情况设置 | 用于 Milvus 访问认证,保障数据安全。 |
HNSW | M=16, efConstruction=200 | 经验证在多数场景下,M=16 平衡了查询效率与索引大小,efConstruction 影响构建质量。 |
IP | L2 | 适用于文本嵌入向量,L2 距离能有效衡量语义相似度。 |
| 召回条数 | 20-30 | 在 200K 上下文限制下,此范围内的召回条数通常能覆盖重要信息,并留有足够空间给问题和指令。 |
| 单段最大长度 | 500-800 字符 | 确保每段信息完整,同时避免单段过长占用过多上下文预算。 |
这两者互相约束的地方
模型上下文窗口与向量库召回结果之间存在直接制约。在 200K 的上下文预算下,召回条数与每段长度的乘积必须小于此上限,并为用户问题、系统指令及模型输出预留空间。100000 token 的引用上限进一步限制了召回内容的总量。Milvus 返回的召回条数应首先满足此引用上限,超出部分将被截断。索引参数如 efConstruction 调大,虽然可能提升 Milvus 召回的准确性,但也会增加索引构建时间与查询延迟。对于需要快速响应的对话场景,需权衡 Milvus 的查询性能与模型的实时交互需求。
容易做错的三处
- 接口调用返回
401 Unauthorized:MILVUS_TOKEN配置错误或缺失,导致 Milvus 认证失败。 - 知识库召回结果为空或不相关:向量索引未正确构建,或 Milvus
IP距离度量与嵌入模型不匹配。 - 模型回答内容明显截断:知识库召回条数过多,或单段长度过长,导致总召回内容超过 100000 token 的引用上限。
怎么确认配好了
- 检查 Milvus 客户端日志,确认
MILVUS_ADDRESS连接正常,无连接超时或认证失败错误。 - 在 FastGPT 知识库管理界面,上传文档并进行一次问答测试,观察召回结果的条数与内容是否符合预期。
- 针对典型问题进行多轮对话测试,结合模型输出长度和上下文使用情况,评估 200K 上下文窗口的利用效率。
- 监控 Milvus 查询延迟,确保在
HNSW参数配置下,查询响应时间满足业务需求。