这一档模型的参数意味着什么
StepFun 256K 上下文这一档模型,其上下文长度 maxContext 达到 256000 token,意味着单次请求可以处理极大量的输入信息。引用上限 quoteMaxToken 为 240000 token,这部分预算专用于承载从向量库召回并作为上下文提供给模型的事实性内容。模型的引用内容总 token 消耗由 quoteMaxToken 限制。段落条数则由检索系统决定,是独立于引用上限的另一个维度。模型支持工具调用 tool_calling: true,允许通过预设工具扩展其功能边界。由于 image_input: false,此档模型不支持直接处理图片输入。
配 OceanBase 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OCEANBASE_URL | ob://user:pass@host:port/database | 连接 OceanBase 数据库的统一入口,需包含认证信息与目标数据库。 |
ef_construction | 128–256 | 索引构建参数,影响索引质量与构建速度。较高的值能提升搜索准确率,但会增加构建时间。 |
m | 16 | HNSW 算法中的邻居数量参数,影响召回质量与查询性能。适中值可在效率与准确性间取得平衡。 |
recall_limit | 20 条 | 向量库单次检索返回的最大段落数量,需根据模型引用上限与单段平均长度综合考量。 |
chunk_size | 500-800 字符 | 文档切分时每个段落的字符数,直接影响单段的 token 消耗。 |
max_connections | 32 | 数据库连接池的最大连接数,确保在高并发场景下 FastGPT 能稳定访问 OceanBase。 |
这两者互相约束的地方
FastGPT 中,召回条数与每段长度的乘积,其总 token 量必须控制在这一档模型的上下文长度 maxContext 256000 token 范围之内。引用上限 quoteMaxToken 独立于召回条数,它限制的是所有引用内容合计占用的 token 预算。向量库返回的段落数量,与这些段落转化成的 token 总量是两个不同的指标。当每段平均 token 数较大时,可能在召回条数不多时就触及 quoteMaxToken 上限;反之,若每段较短,则可能在召回条数很多时才达到上限。OceanBase 的 ef_construction 或 m 等索引参数调大后,通常能提升召回的精准度,这意味着即使召回条数略有减少,其内容质量也可能更高,从而更有效地利用模型有限的引用预算。
容易做错的三处
- 日志显示
SQLSTATE: 08001连接超时或认证失败:OCEANBASE_URL配置的用户名、密码、主机或端口不正确。 - 检索结果返回的段落数量远少于预期,或语义相关性差:
ef_construction或m参数设置过低,导致索引质量不佳,影响召回效果。 - 模型回答内容明显偏短或不完整,且引用内容缺失:向量库返回的段落总 token 量超过了模型的
quoteMaxToken限制,导致部分引用内容被截断。
怎么确认配好了
- 运行 FastGPT 内置的知识库测试功能,检查 OceanBase 检索召回的段落数量与内容是否符合预期,确认
recall_limit与chunk_size配置合理。 - 在 FastGPT 控制台中,观察模型处理复杂查询时,其上下文使用量是否接近
quoteMaxToken但未溢出,判断引用预算利用效率。 - 检查 OceanBase 数据库连接池的活跃连接数,确保
max_connections配置能满足 FastGPT 的并发请求需求,避免连接瓶颈。