模型指南官方文档5 分钟阅读模型组合页

Qwen 256K 上下文 这一档模型配 Milvus 的配置口径

Qwen 256K 模型的上下文长度 `maxContext` 达到 256000 token,这为单次会话中集成大量召回内容提供了充足空间。单次最大输出 `maxTokens` 虽未明确标注,但通常足以支持生成较长的回答。引用上限 `quoteMaxToken` 为 256000 token,这意

这一档模型的参数意味着什么

Qwen 256K 模型的上下文长度 maxContext 达到 256000 token,这为单次会话中集成大量召回内容提供了充足空间。单次最大输出 maxTokens 虽未明确标注,但通常足以支持生成较长的回答。引用上限 quoteMaxToken 为 256000 token,这意味着所有引用内容合计占用的 token 预算上限是 256000 token。引用内容的段落条数由检索侧的返回条数决定,引用上限与段落条数是不同的衡量维度。工具调用能力 tool_calling 为 true,支持模型在对话过程中调用外部工具执行特定操作。图片输入 image_input 为 false,表明该模型不支持直接处理图像输入。

配 Milvus 要定哪些

配置项建议取法这样取的依据
MILVUS_ADDRESSmilvus-service:19530Milvus 服务内部访问地址,根据部署环境调整
MILVUS_TOKEN按实测标定用于 Milvus 认证的 API Key,确保安全访问
HNSWM=32, efConstruction=200HNSW 索引参数,平衡查询性能和索引构建时间
IPL2向量距离度量方式,适用于多种嵌入模型
召回条数10-20 条结合引用上限和单段长度,避免超限,确保相关性
单段最大字符数500-800 字符避免单段过长导致 token 浪费,或过短丢失语义信息

这两者互相约束的地方

Qwen 256K 模型的上下文预算高达 256000 token,这使得在 Milvus 中召回的条目数量与每段长度的乘积,只要不超过这个预算,模型就能处理。引用上限按 token 计,向量库返回的按条数计。当单段文本较短时,可以在不触及引用上限的情况下召回更多条;当单段文本较长时,即使召回条数不多,也可能迅速达到引用上限。引用上限限定的是引用内容总计的 token 消耗,这与检索到的文档段落数量是两个独立的约束条件。Milvus 的索引参数,例如 HNSW 的 efConstruction 值调大,会增加索引构建时间但提升召回精度。更高的召回精度可以为模型提供更相关的上下文,从而提升模型生成回答的质量,即使召回条数保持不变。

容易做错的三处

  • 日志显示 Milvus connection failed: rpc error: code = Unavailable。原因:MILVUS_ADDRESS 配置错误或 Milvus 服务未启动。
  • 模型返回的回答内容与召回内容关联性弱,甚至出现幻觉。原因:向量库检索到的内容相关性不足,或者 召回条数 配置过少导致上下文信息不完整。
  • 生成回答时出现 Context window exceeded 错误。原因:召回内容的总 token 数超过了模型的引用上限 quoteMaxToken。

怎么确认配好了

  • 执行一次包含 Milvus 检索的问答流程,观察日志中 Milvus 的查询耗时,并与基线数据进行比较,判断 HNSW 索引参数是否合理。
  • 在 FastGPT 界面查看模型调用日志,确认 quoteMaxToken 字段的值是否与预期相符,以及实际引用 token 消耗是否在预算内。
  • 对多组测试问题进行问答,检查模型回答中引用内容的准确性和完整性,确保召回条数和单段长度能够有效支撑回答。
  • 使用 Milvus 客户端工具连接 MILVUS_ADDRESS,执行简单的向量插入和查询操作,验证连接配置 MILVUS_TOKEN 的正确性。

参考资料