这一档模型的参数意味着什么
AntLing 256K 上下文模型系列,其上下文长度 maxContext 达到 256000 token,决定了单次请求中模型可以处理的最大输入信息量,包括用户查询、历史对话和召回内容。引用上限 quoteMaxToken 为 240000 token,这意味着在生成回复时,可用于引用外部知识的 token 总量限制在此范围内。引用内容的总 token 量是模型在生成回复时引用的依据。段落条数由检索侧返回,决定了可供模型选择的知识片段数量。工具调用 true 表示模型支持通过外部工具扩展其能力,允许执行特定操作或获取实时信息。图片输入 false 表明模型不直接接受图像作为输入。
配 OceanBase 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OCEANBASE_URL | jdbc:mysql://[host]:[port]/[database] | 指定 OceanBase 数据库的连接地址和端口,确保 FastGPT 可以访问。 |
ef_construction | 64 | HNSW 索引构建参数,影响索引质量和构建速度,此值在性能与召回率之间取得平衡。 |
m | 16 | HNSW 索引参数,控制每个节点的最大连接数,影响召回精度和查询延迟。 |
recall_top_k | 3-5 | 向量检索时返回的相似度最高条数,结合引用上限与单段长度优化。 |
chunk_overlap | 50-100 字符 | 分段时相邻文本块的重叠部分,有助于保留上下文连贯性。 |
max_chunk_size | 800-1200 字符 | 单个文本块的最大长度,避免单个块过大导致引用效率降低。 |
这两者互相约束的地方
AntLing 256K 上下文模型处理的最大输入信息量受限于 256000 token。当从 OceanBase 检索到内容时,召回的条数乘以每段的平均长度,其总和不能超出这个上下文预算。引用上限 240000 token 是对引用内容总 token 量的约束,而 OceanBase 返回的是具体知识片段的条数。因此,是总引用 token 量先触及上限,还是召回条数先达到模型处理的上限,取决于每个知识片段的平均 token 长度。如果每个片段较短,可能会召回更多条数才达到 token 上限;如果片段较长,则较少条数即可触及 token 上限。OceanBase 的 ef_construction 和 m 等索引参数调大后,通常会提高检索的准确性和召回率,意味着模型能够获得更相关、更丰富的背景信息,这有助于在 240000 token 的引用上限内填充更高质量的内容。
容易做错的三处
- 在 FastGPT 界面配置 OceanBase 时,连接测试失败,显示
Error: Access denied for user。原因:OCEANBASE_URL中提供的数据库用户或密码不正确,或数据库权限不足。 - 模型回答内容无法引用任何知识库内容,日志中显示
Quote content exceeds token limit。原因:召回的知识片段总 token 量超出了quoteMaxToken的限制,模型无法将所有召回内容纳入引用范围。 - 检索结果条数与预期不符,或检索耗时过长。原因:OceanBase 的
ef_construction或m参数设置不当,导致索引效率低下或召回策略不优化。
怎么确认配好了
- 在 FastGPT 知识库管理页面,尝试添加 OceanBase 数据源,并点击连接测试按钮,确保返回“连接成功”状态。
- 上传文档到知识库后,通过知识库的“测试检索”功能,输入测试问题,检查返回的召回条数和内容相关性,并观察日志中是否有关于 token 限制的警告。
- 使用 FastGPT 的调试功能,在模型请求中观察
quoteMaxToken字段的实际消耗情况,确保其在 240000 token 的限制内,并根据实际业务场景评估召回条数和引用内容的匹配度。 - 在 FastGPT 的日志输出中,检查是否存在 OceanBase 相关的错误或警告信息,特别是关于查询超时或索引性能的提示。