这一档模型的参数意味着什么
Qwen 260K 上下文这一档模型,其上下文长度(maxContext)达到 260000 token,允许在单次交互中处理极大的输入量。引用上限(quoteMaxToken)为 260000 token,这意味着模型在生成回答时,可引用内容的总预算是 260000 token。段落条数由检索侧决定,引用内容总 token 量由段落条数和每段长度共同决定。模型支持工具调用(tool_calling=true),可以执行外部函数或 API,但不支持图片输入(image_input=false)。这些特性使得模型在处理复杂、长文本的 RAG 任务时具有显著优势。
配 OceanBase 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OCEANBASE_URL | ob://user:password@host:port/database | 连接 OceanBase 数据库实例的统一入口,遵循 MySQL 协议兼容。 |
ef_construction | 100–200 | 影响索引构建时的邻居数量,数值越大,索引质量越高,检索召回更精准。 |
m | 32 | HNSW 算法中最大邻居数量,影响索引的内存占用和查询速度。 |
recall_top_k | 前 5–10 条 | 结合模型上下文长度,平衡召回质量与 token 消耗。 |
chunk_size | 800–1200 字符 | 单个文本块的理想长度,兼顾信息完整性和检索效率。 |
vector_dimension | 按实测标定 | 向量维度应与 embedding 模型输出维度保持一致。 |
说明:SEEKDB 与 OceanBase 使用同一套控制器实现,配置口径相同。
这两者互相约束的地方
模型上下文长度为 260000 token,这是模型单次处理所有输入(包括用户提问、系统指令和召回内容)的总限制。向量库返回的召回内容,其总 token 数不能超过这个限制。引用上限按 token 计,向量库返回的按条数计。当向量库返回多段内容时,每段内容的平均 token 数与召回条数的乘积,共同决定了引用内容的总 token 量。引用上限是 260000 token,它约束的是最终被模型引用的所有内容的总量。如果每段内容较短,可以引用更多的条数;如果每段内容较长,则能引用的条数会相应减少。索引参数如 ef_construction 和 m 调大后,向量检索的精度和召回质量会提高,可能导致召回内容更相关,进而影响模型对引用内容的理解和生成。
容易做错的三处
- 日志显示
connection refused:OCEANBASE_URL配置错误,导致无法连接 OceanBase 数据库。 - 检索结果返回条数远低于预期:向量库索引未正确构建,或
recall_top_k设置过小。 - 模型回答内容缺乏相关性:
chunk_size过大或过小,导致向量召回的文本片段信息不足或冗余。
怎么确认配好了
- 在 FastGPT 管理界面,测试知识库问答,检查模型回答是否能准确引用到知识库内容。
- 观察模型推理日志,确认召回条数和引用 token 数是否在预期范围内。
- 监测 OceanBase 数据库的 CPU 和内存使用率,确保在高并发查询下系统稳定运行。
- 通过 FastGPT 的调试功能,查看每次问答的召回内容和 token 消耗,据此调整
recall_top_k和chunk_size。