这一档模型的参数意味着什么
此档模型提供 128000 的上下文长度,决定了单次交互中模型可处理的输入总量。引用上限为 50000 token,这是用于限定召回内容可占据的 token 预算。段落条数由检索系统返回,与引用内容的 token 预算是两个独立的概念。此模型支持工具调用,允许通过外部工具增强模型能力。此模型不支持图片输入,因此不适用于处理视觉信息。
配 OceanBase 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OCEANBASE_URL | jdbc:mysql://<host>:<port>/<db>?user=<user>&password=<pass> | 连接 OceanBase 实例的必要信息 |
ef_construction | 100 | 索引构建时邻居数量,影响检索质量与构建速度 |
m | 16 | HNSW 算法的层数,影响召回精度与查询效率 |
recall_max_tokens | 48000 | 预留部分 token 给问题和指令,避免超出引用上限 |
chunk_size | 800 | 文本切分段落的字符数,影响单段信息密度 |
chunk_overlap | 100 | 文本切分段落的重叠字符数,确保上下文连贯性 |
这两者互相约束的地方
模型上下文长度与向量库召回内容之间存在直接制约。召回的文档条数乘以每段文本的平均 token 长度,其总和不能超出模型的上下文预算。引用上限限制了所有召回内容的总 token 量,而向量库返回的是固定条数的段落。当每段文本较短时,可能会在达到引用上限之前召回更多条段落;当每段文本较长时,可能在召回少量段落后即触及引用上限。OceanBase 的索引参数,例如 ef_construction 和 m,调大后能提升召回精度,这意味着模型能获得更相关的信息,但同时也可能增加向量库的存储和计算开销,需要与模型处理能力及响应时间进行权衡。
容易做错的三处
- 配置
OCEANBASE_URL后连接失败,错误提示Access Denied。原因:数据库用户名或密码不正确,或 IP 白名单未配置。 - 模型返回的回答中引用内容为空或不完整。原因:
recall_max_tokens配置过低,导致实际召回内容未充分利用引用上限。 - 检索结果与预期偏差较大,召回内容不相关。原因:
ef_construction或m参数设置过小,导致向量索引质量不佳。
怎么确认配好了
- 检查 FastGPT 控制台的「知识库」-「向量库」配置页面,确认
OCEANBASE_URL显示为「已连接」。 - 上传文档到知识库,观察 FastGPT 日志中是否存在 OceanBase 相关的索引构建成功信息。
- 在知识库中进行一次测试检索,并查看返回的文档条数和内容,确保与预期一致。
- 进行一次端到端问答测试,观察模型回答中引用部分的完整性与相关性,判断引用上限是否合理利用。