这一档模型的参数意味着什么
上下文长度 1000000 决定了模型单次处理的文本总量上限,包括输入提示词、召回内容和模型生成回答。单次最大输出决定了模型生成回答的长度限制。引用上限 1000000 token 是对引用内容总量的预算,它限制了模型在生成回复时可以参考的引用文本的累计大小。检索系统返回的段落条数与引用上限是两个独立维度。图片输入能力允许模型处理图像信息,工具调用能力则支持模型与外部函数交互,扩展其解决问题的范围。
配 Milvus 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
MILVUS_ADDRESS | milvus-service.default.svc.cluster.local:19530 | 内部集群服务发现地址,保障低延迟连接 |
MILVUS_TOKEN | 按实际密钥填写 | 认证凭证,确保访问安全与权限 |
index_type | HNSW | HNSW 索引在稠密向量搜索中兼顾查询效率与召回率 |
metric_type | IP | IP(内积)距离度量适用于衡量文本嵌入向量的语义相似性 |
ef | 128 | 影响 HNSW 搜索效率与精度,该值提供良好平衡 |
search_k | 前 5 条 | 根据模型引用上限与单段平均长度,优先召回高相关性条目 |
这两者互相约束的地方
召回条数与每段文本的长度共同决定了总的召回内容量,此总量必须控制在模型的上下文长度预算之内。引用上限是按 token 计算的,而向量库返回的是固定条数的文档段落。当每段文本较短时,可能会在达到引用上限之前,先触及召回条数的限制;反之,若每段文本较长,则可能在达到少数召回条数时,便已耗尽引用上限。索引参数如 HNSW 的 ef 或 M 值调大,会提升 Milvus 在相似度搜索中的召回精度,这意味着模型能获得更相关的引用内容,但也可能增加索引构建时间与存储开销。
容易做错的三处
- 日志显示
Milvus connection failed: [Error: 13, details: "Failed to connect to server"]:MILVUS_ADDRESS配置错误或 Milvus 服务未启动。 - 检索结果返回的条数总是少于预期:向量库查询的
limit参数被设置过小,或数据量不足。 - 模型输出内容与引用内容关联度低:索引参数
metric_type选择不当,未能准确捕获向量间的语义关系。
怎么确认配好了
- 执行一次包含 Milvus 向量检索的完整对话流程,检查 FastGPT 界面中“引用内容”是否成功显示。
- 通过 Milvus 客户端工具,验证
MILVUS_ADDRESS和MILVUS_TOKEN配置后,能否正常连接并执行向量查询。 - 在 FastGPT 知识库管理页面,观察知识库分段后的平均 token 数,并以此为基准,判断单次查询返回的条数是否合理,以避免超出模型引用上限。