模型指南官方文档4 分钟阅读模型组合页

Siliconflow 128K 上下文 这一档模型配 OceanBase 的配置口径

此档模型提供 128000 的上下文长度,决定了单次交互中模型可处理的输入总量。引用上限为 50000 token,这是用于限定召回内容可占据的 token 预算。段落条数由检索系统返回,与引用内容的 token 预算是两个独立的概念。此模型支持工具调用,允许通过外部工具增强模型能力。此模型不支持图

这一档模型的参数意味着什么

此档模型提供 128000 的上下文长度,决定了单次交互中模型可处理的输入总量。引用上限为 50000 token,这是用于限定召回内容可占据的 token 预算。段落条数由检索系统返回,与引用内容的 token 预算是两个独立的概念。此模型支持工具调用,允许通过外部工具增强模型能力。此模型不支持图片输入,因此不适用于处理视觉信息。

配 OceanBase 要定哪些

配置项建议取法这样取的依据
OCEANBASE_URLjdbc:mysql://<host>:<port>/<db>?user=<user>&password=<pass>连接 OceanBase 实例的必要信息
ef_construction100索引构建时邻居数量,影响检索质量与构建速度
m16HNSW 算法的层数,影响召回精度与查询效率
recall_max_tokens48000预留部分 token 给问题和指令,避免超出引用上限
chunk_size800文本切分段落的字符数,影响单段信息密度
chunk_overlap100文本切分段落的重叠字符数,确保上下文连贯性

这两者互相约束的地方

模型上下文长度与向量库召回内容之间存在直接制约。召回的文档条数乘以每段文本的平均 token 长度,其总和不能超出模型的上下文预算。引用上限限制了所有召回内容的总 token 量,而向量库返回的是固定条数的段落。当每段文本较短时,可能会在达到引用上限之前召回更多条段落;当每段文本较长时,可能在召回少量段落后即触及引用上限。OceanBase 的索引参数,例如 ef_construction 和 m,调大后能提升召回精度,这意味着模型能获得更相关的信息,但同时也可能增加向量库的存储和计算开销,需要与模型处理能力及响应时间进行权衡。

容易做错的三处

  • 配置 OCEANBASE_URL 后连接失败,错误提示 Access Denied。原因:数据库用户名或密码不正确,或 IP 白名单未配置。
  • 模型返回的回答中引用内容为空或不完整。原因:recall_max_tokens 配置过低,导致实际召回内容未充分利用引用上限。
  • 检索结果与预期偏差较大,召回内容不相关。原因:ef_construction 或 m 参数设置过小,导致向量索引质量不佳。

怎么确认配好了

  • 检查 FastGPT 控制台的「知识库」-「向量库」配置页面,确认 OCEANBASE_URL 显示为「已连接」。
  • 上传文档到知识库,观察 FastGPT 日志中是否存在 OceanBase 相关的索引构建成功信息。
  • 在知识库中进行一次测试检索,并查看返回的文档条数和内容,确保与预期一致。
  • 进行一次端到端问答测试,观察模型回答中引用部分的完整性与相关性,判断引用上限是否合理利用。

参考资料