这一档模型的参数意味着什么
moonshot-v1-8k 模型提供 8000 token 的上下文长度,这意味着一次交互中可以处理的总 token 量。引用上限为 6000 token,这是模型在生成回答时可以参考的外部信息(即召回内容)的预算。段落条数由检索侧决定,引用上限限定的是这些内容在模型内部的 token 消耗。工具调用功能表示该模型能够解析并执行预设的外部工具,支持复杂任务处理。图片输入功能为 false,表明该模型不直接支持视觉信息处理。
配 OceanBase 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OCEANBASE_URL | mysql://user:pass@host:port/database | FastGPT 连接 OceanBase 的标准 MySQL 协议连接字符串 |
ef_construction | 64 | 影响索引构建时的图连接度,平衡查询性能与索引大小 |
m | 16 | 影响 HNSW 索引中每个节点的最大连接数,平衡召回质量与查询延迟 |
recall_max_tokens | 5000 | 留出 1000 token 给模型指令和回答,确保引用内容在引用上限内 |
recall_top_k | 5 | 结合单段平均 token 数,避免超出引用上限 |
chunk_overlap_size | 100 字符 | 确保上下文衔接,提升召回内容完整性 |
这两者互相约束的地方
模型 8000 token 的上下文预算需要合理分配给系统指令、用户问题、召回内容和模型回答。引用上限 6000 token 对向量库返回的内容构成直接约束。向量库召回的按条数计,而引用上限按 token 计,当单段平均 token 数较高时,即使召回条数不多,也可能迅速触及引用上限。反之,如果段落较短,则可以召回更多条目。索引参数 ef_construction 和 m 调大,通常会提升向量检索的精度和召回质量。这意味着向量库能够返回更相关的文档段落,但同时也可能增加索引构建和查询的计算开销。在模型引用上限固定的情况下,提高召回质量有助于在有限的 token 预算内提供更高价值的引用信息。
容易做错的三处
- 日志显示
SQLSTATE: 28000错误:OCEANBASE_URL中提供的数据库用户权限不足或密码错误,导致无法连接 OceanBase。 - 检索结果中的引用内容为空或不相关:向量库的
ef_construction或m参数设置过低,导致索引构建质量不佳,影响检索召回效果。 - 模型回答经常被截断,且没有引用内容:
recall_max_tokens参数设置过高,导致召回内容占用过多上下文,挤占了模型生成回答的空间。
怎么确认配好了
- 通过 FastGPT 后台的调试工具,观察模型请求的
context_length,确认召回内容总 token 数未超过recall_max_tokens。 - 在知识库管理页面,尝试上传不同长度的文档,观察分段结果和索引构建是否正常,并进行少量测试查询,确认返回的
top_k条目与预期相关。 - 运行一个包含工具调用的复杂查询,检查模型是否能正确解析工具请求,并观察 OceanBase 的查询日志,确认向量检索操作的延迟符合预期。