这一档模型的参数意味着什么
Qwen 128K 上下文这一档模型,其上下文长度(maxContext)为 128000 token,这意味着模型单次请求能够处理的输入信息总量较大。引用上限(quoteMaxToken)为 50000 token,这是 FastGPT 在生成回答时,从知识库中召回并注入到模型提示词中的引用内容所能占用的最大 token 预算。它不限定引用的条数,而是限定引用内容的总体积。工具调用支持意味着模型能够与外部工具进行交互以完成特定任务,而图片输入为 false 则表明模型不具备直接处理图像信息的能力。
配 OceanBase 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OCEANBASE_URL | ob://user:password@host:port/database | 连接 OceanBase 实例的完整 URL,包含认证信息。 |
ef_construction | 64 | HNSW 索引构建时的邻居数量,影响索引质量与构建速度。 |
m=16 | 16 | HNSW 索引中每个节点的最大连接数,影响召回精度与内存占用。 |
recall_top_k | 3–7 | 每次检索从 OceanBase 返回的向量条数,需结合单条文档长度和引用上限调整。 |
chunk_size | 800–1200 字符 | 单个文档块的建议长度,过长会降低检索精度,过短会增加召回条数。 |
max_connections | 按实测标定 | OceanBase 连接池的最大连接数,确保并发请求下的稳定性。 |
这两者互相约束的地方
Qwen 128K 上下文模型的 128000 token 上下文长度是总预算,其中 50000 token 专门用于引用内容。OceanBase 返回的是固定条数的向量段落。因此,召回条数乘以每段的平均 token 长度,必须控制在 50000 token 引用上限之内,且不应使总输入超过 128000 token。引用上限是 token 预算,而 OceanBase 返回的是段落条数,两者不是直接等价的量。究竟是引用上限先触顶,还是召回条数过多导致总上下文超限,取决于知识库中每段内容的实际长度。OceanBase 的 ef_construction 和 m 参数调大,通常会提高召回精度,但也可能增加索引构建时间与内存消耗,进而影响 FastGPT 整体的响应效率。SEEKDB 与 OceanBase 在配置口径上保持一致,可参考上述参数进行配置。
容易做错的三处
- 检索日志显示
Context window exceeded:召回的条数过多,或者单条内容过长,导致引用内容的总 token 量超过了模型的引用上限。 - 模型返回的回答中知识库内容缺失或不准确:
ef_construction或m参数设置过低,导致 OceanBase 向量检索精度不足,未能召回最相关的段落。 - 数据导入或检索时出现
Connection refused错误码:OCEANBASE_URL配置有误,导致 FastGPT 无法连接到 OceanBase 实例。
怎么确认配好了
- 在 FastGPT 知识库管理界面,上传多篇文档并观察切块后的文档长度是否符合预期。
- 进行多次问答测试,观察模型返回的引用内容是否准确且数量适中,同时检查 FastGPT 运行日志中是否存在
Context window exceeded警告。 - 通过 OceanBase 监控工具,检查
ef_construction和m参数调整后,查询响应时间与索引构建时间的波动情况,并根据实际负载设定合理的阈值。 - 使用 OceanBase SQL 客户端工具,验证
OCEANBASE_URL中提供的连接信息能够成功连接到数据库,并执行基本的查询操作。