这一档模型的参数意味着什么
Qwen 32K 这一档模型,其 maxContext 值为 32000 token,这决定了单次请求中模型可以处理的最大输入长度,包括用户查询、历史对话以及召回内容。模型单次最大输出长度未明确标注,通常这意味着在实际应用中会受到下游系统或平台默认值的限制。quoteMaxToken 设定为 30000 token,这限制了模型在生成回复时可以引用的召回内容的总体 token 预算。引用内容的段落数量由检索系统的配置决定。此档模型支持工具调用 true,允许其通过外部工具扩展能力。不支持图片输入 false,表示无法直接处理图像数据。
配 OceanBase 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OCEANBASE_URL | ob://user:pass@host:port/db | 连接 OceanBase 数据库的唯一入口,格式需符合驱动要求。 |
ef_construction | 100–200 | 索引构建时邻居节点的数量,影响召回质量与索引速度的平衡。 |
m | 16 | HNSW 图中每个节点的最大连接数,影响召回性能和内存占用。 |
recall_top_k | 5–10 | 向量检索时返回的相似度最高条目数,影响召回内容范围。 |
segment_length | 200–500 字符 | 单个文本段的推荐长度,影响引用内容的粒度。 |
embedding_model_dim | 1536 | 向量维度需与所使用的 embedding 模型输出维度一致。 |
这两者互相约束的地方
Qwen 32K 模型的 maxContext 为 32000 token,这意味着所有输入内容的总和必须控制在此范围内。向量库召回的段落数量与每个段落的长度相乘,必须小于或等于这个上下文窗口。quoteMaxToken 设定为 30000 token,这是模型用于引用召回内容的预算。向量库返回的是固定数量的段落,而这些段落转换为 token 后的总和受到 quoteMaxToken 的限制。当单个段落较长时,即使召回条数不多,也可能迅速触及 quoteMaxToken 上限;反之,若段落较短,则可以引用更多条目。将 OceanBase 的 ef_construction 和 m 等索引参数调大,通常会提高召回的准确性,这对于 Qwen 模型在更精准的召回内容基础上进行推理是有利的,但也可能增加索引构建的时间和查询延迟。
容易做错的三处
- 日志中出现
connection refused错误,原因是OCEANBASE_URL配置中的主机或端口信息不正确。 - 检索结果中的
score字段异常,原因可能是embedding_model_dim与实际 embedding 模型维度不匹配,导致向量不兼容。 - 检索返回的条目数远少于预期,原因在于
recall_top_k设置过低,限制了向量库的召回范围。
怎么确认配好了
- 通过 FastGPT 界面发起测试,观察模型回复是否流畅且引用内容准确,评估其与用户期望的契合度。
- 检查 OceanBase 的慢查询日志,确认向量检索操作的耗时是否在可接受范围内。
- 在 FastGPT 的调试界面,查看单次请求的
maxContext占用情况,确保召回内容未超过上下文窗口限制。 - 模拟高并发场景,观察 OceanBase 的 CPU 和内存使用率,确保系统在高负载下仍能稳定运行。