模型指南官方文档4 分钟阅读模型组合页

Qwen 32K 上下文 这一档模型配 Milvus 的配置口径

Qwen 32K 上下文模型系列,其上下文长度为 32000 token,决定了每次交互中模型能处理的输入内容总量,包含指令、历史对话和召回内容。单次最大输出长度未明确标注,通常由平台侧或实际模型能力决定,影响模型生成回答的最大篇幅。引用上限为 30000 token,此参数限定了模型在生成回复时可

这一档模型的参数意味着什么

Qwen 32K 上下文模型系列,其上下文长度为 32000 token,决定了每次交互中模型能处理的输入内容总量,包含指令、历史对话和召回内容。单次最大输出长度未明确标注,通常由平台侧或实际模型能力决定,影响模型生成回答的最大篇幅。引用上限为 30000 token,此参数限定了模型在生成回复时可以引用的外部召回内容的总 token 预算。引用内容的总 token 数量受此限制,而具体的段落条数则由检索系统的返回结果决定。工具调用能力为 true,意味着该模型支持通过外部工具扩展其能力。图片输入能力为 false,表明该模型不直接处理图像输入。

配 Milvus 要定哪些

配置项建议取法这样取的依据
MILVUS_ADDRESSlocalhost:19530 或 your_milvus_ip:19530Milvus 服务的标准监听地址与端口
MILVUS_TOKEN按实际部署的 Milvus 安全凭证访问 Milvus 服务的认证凭据,保障数据安全
index_type (索引类型)HNSWHNSW 索引在召回效率和精度之间有良好平衡,适用于大规模向量检索
metric_type (度量类型)IP (内积)与 Qwen 模型向量化结果的语义相似度计算方式保持一致,确保检索效果
nlist (HNSW 参数)128影响索引构建速度和查询精度,需结合数据集规模调整
ef (HNSW 参数)64查询时控制邻居节点搜索范围,提高召回精度,但会增加查询时间

这两者互相约束的地方

Qwen 32K 上下文模型的上下文预算为 32000 token,这意味着召回内容的总长度、用户查询与历史对话的总和不能超过此限制。向量库 Milvus 返回的是固定数量的段落,而引用上限是按 token 计数的。当每段召回内容的平均长度较短时,可能会在达到引用上限的 token 预算前就已返回较多段落。反之,如果每段内容较长,则可能在返回少量段落后就触及引用上限。因此,需要根据实际业务场景调整召回条数和每段内容的长度,以充分利用模型的引用预算。Milvus 的索引参数,如 ef 和 nlist,调大通常会提升召回精度,从而为模型提供更相关的内容。更精确的召回有助于模型生成高质量的回复,但也会增加向量检索的计算开销。

容易做错的三处

  • 日志显示 Milvus connection failed: [Error 19530]:MILVUS_ADDRESS 配置错误或 Milvus 服务未启动。
  • 模型回复中引用内容不完整或缺失:向量库返回的召回条数过多导致引用内容总 token 超过了模型的 quoteMaxToken 上限。
  • 检索结果与预期语义不符:metric_type 未正确配置为 IP,或向量化模型与 Milvus 存储的向量不匹配。

怎么确认配好了

  • 运行一次带向量召回的对话,检查 FastGPT 控制台的请求详情,确认 MILVUS_ADDRESS 和 MILVUS_TOKEN 已正确传递并成功连接。
  • 观察模型回复中引用的内容,确保引用内容的总 token 数在 quoteMaxToken 预算内,且引用完整性符合预期。
  • 对比不同 index_type 和 metric_type 配置下的检索结果,评估检索准确性是否达到业务需求,并以此确定合理的参数阈值。
  • 通过 FastGPT 平台进行多次带检索的对话测试,监控 Milvus 服务的查询延迟和资源消耗,确保在实际负载下系统表现稳定。

参考资料