这一档模型的参数意味着什么
StepFun 这一档模型,以 step-1v-8k 为代表,其上下文长度为 8000 Token。这意味着在单次交互中,模型能够处理的总输入信息量,包括用户查询、系统指令、历史对话以及知识库召回内容,上限为 8000 Token。引用上限同样为 8000 Token,这为知识库召回内容的长度设定了明确的天花板,确保召回内容不会因过长而超出模型处理能力。图片输入 true 表明此模型支持多模态输入,能够处理图像信息,但工具调用 false 则限制了其直接与外部系统或 API 进行交互的能力,所有外部操作需通过 FastGPT 平台进行编排。
配 OceanBase 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OCEANBASE_URL | ob://user:password@host:port/database?params | 连接 OceanBase 实例的必要信息,确保可达性与权限 |
ef_construction | 64 | HNSW 索引构建参数,影响索引质量与构建速度,64 是平衡点 |
m | 16 | HNSW 索引图的邻居数量,影响召回精度与查询延迟,16 为常用值 |
vector_dimension | 1536 | 匹配模型输出嵌入向量的维度,例如 OpenAI text-embedding-ada-002 的维度 |
recall_count | 5 | 知识库召回的向量条数,平衡召回质量与上下文长度 |
segment_length | 400 字符 | 知识库分段的建议长度,兼顾语义完整性与模型上下文限制 |
这两者互相约束的地方
模型 8000 Token 的上下文长度是核心约束。知识库召回的条数 (recall_count) 与每个分段的长度 (segment_length) 需严格控制,以确保召回的总 Token 数加上用户查询及系统指令后,不超过 8000 Token。例如,如果 recall_count 设置为 5,每个分段平均 400 字符(约 200 Token),则知识库召回部分占用约 1000 Token。引用上限 8000 Token 与向量库返回条数是两个层面的限制,FastGPT 会先从 OceanBase 获取指定条数的数据,再根据模型引用上限进行裁剪。索引参数 ef_construction 和 m 调大,通常意味着索引构建时间更长、存储占用更高,但查询时召回的精确度会提升,这对于需要高召回质量以充分利用 8000 Token 上下文的模型至关重要。
容易做错的三处
- 在 FastGPT 界面提示“上下文超出限制”,原因可能是
recall_count或segment_length配置过高,导致召回内容总 Token 数超过模型 8000 Token 上限。 - OceanBase 连接失败,报错
ERR_CONNECTION_REFUSED或AUTH_FAILED,通常是OCEANBASE_URL中的主机、端口、用户名或密码配置不正确。 - 知识库查询结果语义相关性差,但 OceanBase 返回了大量条目,可能是
ef_construction或m配置过低,导致 HNSW 索引构建质量不佳,未能有效捕获语义信息。
怎么确认配好了
- 在 FastGPT 知识库管理界面,上传文档后检查分段数量和每个分段的字符长度,确保符合
segment_length设定。 - 执行一次知识库问答,检查 FastGPT 日志或调试输出中模型实际接收的 Token 数量,确认未超出 8000 Token。
- 通过 FastGPT 的调试功能,查看知识库召回的原始条目和排序,评估召回内容的语义相关性,并与预期召回条数
recall_count进行比对,确定索引参数ef_construction和m是否合理。 - 在 OceanBase 数据库中,查询存储向量的表,确认
vector_dimension与模型输出维度一致,且 HNSW 索引已正确创建。