这一档模型的参数意味着什么
Qwen 256K 模型的上下文长度 maxContext 达到 256000 token,这为单次会话中集成大量召回内容提供了充足空间。单次最大输出 maxTokens 虽未明确标注,但通常足以支持生成较长的回答。引用上限 quoteMaxToken 为 256000 token,这意味着所有引用内容合计占用的 token 预算上限是 256000 token。引用内容的段落条数由检索侧的返回条数决定,引用上限与段落条数是不同的衡量维度。工具调用能力 tool_calling 为 true,支持模型在对话过程中调用外部工具执行特定操作。图片输入 image_input 为 false,表明该模型不支持直接处理图像输入。
配 Milvus 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
MILVUS_ADDRESS | milvus-service:19530 | Milvus 服务内部访问地址,根据部署环境调整 |
MILVUS_TOKEN | 按实测标定 | 用于 Milvus 认证的 API Key,确保安全访问 |
HNSW | M=32, efConstruction=200 | HNSW 索引参数,平衡查询性能和索引构建时间 |
IP | L2 | 向量距离度量方式,适用于多种嵌入模型 |
| 召回条数 | 10-20 条 | 结合引用上限和单段长度,避免超限,确保相关性 |
| 单段最大字符数 | 500-800 字符 | 避免单段过长导致 token 浪费,或过短丢失语义信息 |
这两者互相约束的地方
Qwen 256K 模型的上下文预算高达 256000 token,这使得在 Milvus 中召回的条目数量与每段长度的乘积,只要不超过这个预算,模型就能处理。引用上限按 token 计,向量库返回的按条数计。当单段文本较短时,可以在不触及引用上限的情况下召回更多条;当单段文本较长时,即使召回条数不多,也可能迅速达到引用上限。引用上限限定的是引用内容总计的 token 消耗,这与检索到的文档段落数量是两个独立的约束条件。Milvus 的索引参数,例如 HNSW 的 efConstruction 值调大,会增加索引构建时间但提升召回精度。更高的召回精度可以为模型提供更相关的上下文,从而提升模型生成回答的质量,即使召回条数保持不变。
容易做错的三处
- 日志显示
Milvus connection failed: rpc error: code = Unavailable。原因:MILVUS_ADDRESS配置错误或 Milvus 服务未启动。 - 模型返回的回答内容与召回内容关联性弱,甚至出现幻觉。原因:向量库检索到的内容相关性不足,或者
召回条数配置过少导致上下文信息不完整。 - 生成回答时出现
Context window exceeded错误。原因:召回内容的总 token 数超过了模型的引用上限quoteMaxToken。
怎么确认配好了
- 执行一次包含 Milvus 检索的问答流程,观察日志中 Milvus 的查询耗时,并与基线数据进行比较,判断
HNSW索引参数是否合理。 - 在 FastGPT 界面查看模型调用日志,确认
quoteMaxToken字段的值是否与预期相符,以及实际引用 token 消耗是否在预算内。 - 对多组测试问题进行问答,检查模型回答中引用内容的准确性和完整性,确保召回条数和单段长度能够有效支撑回答。
- 使用 Milvus 客户端工具连接
MILVUS_ADDRESS,执行简单的向量插入和查询操作,验证连接配置MILVUS_TOKEN的正确性。