这一档模型的参数意味着什么
StepFun 的 step-1o-vision-32k 和 step-1v-32k 模型提供 32000 token 的上下文长度,这意味着在单次交互中,模型能够处理和理解的输入信息总量较大,可以包含更多历史对话和召回文档。引用上限同样为 32000 token,这是用于限制引用内容总预算的令牌数。引用内容合计占用的 token 数量受此参数限制。段落条数由检索系统返回,与引用上限的 token 数量是相互独立的两个量。模型支持图片输入,可处理多模态信息,但不支持工具调用,因此无法直接执行外部函数或API。
配 OceanBase 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OCEANBASE_URL | ob://user:password@host:port/database | 数据库连接字符串,确保可达性与权限 |
ef_construction | 100–200 | 构建 HNSW 索引时的邻居搜索参数,影响召回质量和索引时间 |
m=16 | 16 | HNSW 索引中每个节点的最大连接数,影响召回性能与内存占用 |
recall_num | 5–10 条 | 向量检索返回的文档条数,与模型上下文长度匹配 |
chunk_size | 800–1200 字符 | 单个文档块的文本长度,影响检索精度和引用效率 |
distance_metric | COSINE | 向量相似度计算方法,适用于大多数文本嵌入模型 |
这两者互相约束的地方
StepFun 32K 上下文模型能够处理的总输入量是固定的。向量库返回的召回条数与每段文本的长度共同决定了召回内容占用的总 token 数。引用上限是按 token 计算的,而向量库返回的是按条数计量的,因此最终是引用内容的总 token 数达到上限,还是召回条数达到上限,取决于每条召回内容的平均长度。当 OceanBase 索引参数 ef_construction 和 m 调大时,通常能提升检索的准确性和召回质量。这意味着模型可以获得更精准的上下文信息,但同时索引构建和查询的资源消耗也会增加。合理配置这些参数,才能确保模型在 32K 上下文预算内,接收到最相关且完整的信息。
容易做错的三处
- 日志显示 "OceanBase connection refused":原因是没有正确配置
OCEANBASE_URL中的主机、端口或凭证信息。 - 模型回答内容短缺,且引用内容缺失:原因可能是
recall_num配置过低,导致向量库返回的有效召回条数不足。 - 检索查询响应时间过长,导致超时:原因可能是
ef_construction或m值过大,导致向量索引查询计算量剧增。
怎么确认配好了
- 在 FastGPT 管理后台配置 OceanBase 连接后,查看连接状态指示是否为“已连接”。
- 执行一次 RAG 问答流程,观察日志中向量召回的条数是否符合
recall_num的设定。 - 对模型进行多轮对话测试,检查引用内容是否完整、相关,并核对模型输出的 token 数量是否在预期范围内。
- 通过 FastGPT 的性能监控,观察端到端 RAG 延迟,确保查询时间在可接受的阈值内。