这一档模型的参数意味着什么
此档模型提供 128000 token 的上下文长度,决定了单次交互中模型能处理的输入总量。模型单次最大输出长度未明确标注,但通常足以支持复杂回答的生成。引用上限为 128000 token,此预算用于模型引用的内容总量。检索出的段落条数由向量库的返回机制决定,与引用上限是两个独立的概念。此档模型支持图片输入和工具调用能力,可实现多模态交互和外部功能集成。
配 OceanBase 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OCEANBASE_URL | jdbc:mysql://<host>:<port>/<database>?user=<user>&password=<password> | FastGPT 通过 JDBC 连接 OceanBase 数据库,此 URL 遵循 MySQL 协议规范。 |
ef_construction | 64–128 | HNSW 索引构建参数,影响索引质量和构建速度。适当增大可提高召回精度,但会增加索引构建时间。 |
m=16 | 16 | HNSW 图中每个节点的最大连接数,影响召回性能和内存占用。此值在大多数场景下提供良好平衡。 |
recall_top_k | 5–10 | 从 OceanBase 检索的初始段落条数。需结合单段 token 长度和模型引用上限进行权衡。 |
embedding_model | text-embedding-ada-002 | 与 FastGPT 平台兼容的嵌入模型名称,确保向量生成与检索时使用同一模型。 |
max_text_length | 800–1200 字符 | 单个文本段落的最大字符长度。过长的段落可能导致引用上限快速耗尽,过短则可能丢失上下文。 |
说明:SEEKDB 作为 OceanBase 的兼容实现,其配置口径与 OceanBase 完全一致,可参照上述表格进行配置。
这两者互相约束的地方
检索系统返回的段落条数与每段内容的长度,共同决定了最终进入模型上下文的 token 总量。此总量必须严格控制在 128000 token 的上下文长度预算之内。引用上限按 token 计,向量库返回的按条数计。若每段内容较短,则可能在达到引用上限前已返回大量段落;若每段内容较长,则可能在返回少量段落后就触及引用上限。索引参数 ef_construction 或 m 调大,通常会提高向量检索的召回精度,意味着模型能够获得更相关的上下文信息,从而提升回答质量。然而,这也可能增加向量检索的计算开销和响应时间。
容易做错的三处
- 日志显示
Context window exceeded错误。原因在于检索返回的段落总 token 数加上用户提问超出了模型的上下文长度限制。 - 模型返回的回答内容空泛或不相关。原因在于向量检索参数配置不当,导致召回的段落质量不高或与问题关联度低。
- 检索速度明显变慢,页面出现加载超时。原因在于 OceanBase 索引参数(如
ef_construction)设置过高,导致检索计算量过大。
怎么确认配好了
- 在 FastGPT 知识库中上传测试文档,观察文档切分后的段落长度是否符合预期。
- 进行模拟问答,检查模型回答中引用的知识点是否准确且全面,并观察引用的段落是否完整。
- 通过 FastGPT 的调试界面,查看每次检索请求的
recall_top_k值和实际召回的段落数量,确保与配置相符。 - 监控 OceanBase 的查询日志,确认向量检索的响应时间在可接受范围内。