模型指南官方文档4 分钟阅读模型组合页

StepFun 128K 上下文 这一档模型配 OceanBase 的配置口径

`step-1-128k` 模型提供了 128000 的上下文长度,这意味着一次请求中可以处理大量的文本信息,为复杂的 RAG 场景提供了充足的空间。引用上限同样是 128000 token,这是引用内容的总 token 预算。段落的返回条数由检索侧的配置决定,引用上限限制的是这些引用内容的合计 t

这一档模型的参数意味着什么

step-1-128k 模型提供了 128000 的上下文长度,这意味着一次请求中可以处理大量的文本信息,为复杂的 RAG 场景提供了充足的空间。引用上限同样是 128000 token,这是引用内容的总 token 预算。段落的返回条数由检索侧的配置决定,引用上限限制的是这些引用内容的合计 token 量。模型不提供图片输入能力,因此在处理多模态数据时需要进行预处理。同时,该模型不具备工具调用能力,这意味着复杂的外部系统交互需要通过其他方式实现。

配 OceanBase 要定哪些

配置项建议取法这样取的依据
OCEANBASE_URLob://user:password@host:port/database遵循 OceanBase 官方连接协议,确保应用能正确连接数据库。
ef_construction64ef_construction 影响索引构建的质量和速度,建议从 64 开始,根据实际查询性能和构建时间进行调整。
m16m 参数决定了 HNSW 索引中每个节点的最大连接数,m=16 在大多数场景下提供了较好的查询效率与索引大小平衡。
recall_top_k5结合模型引用上限与单段平均 token 数,初始设定为返回前 5 条相关段落,避免不必要的 token 浪费。
chunk_size512单个文本块的理想长度,兼顾了模型上下文处理能力和语义完整性,避免过长或过短的片段。

这两者互相约束的地方

step-1-128k 模型的 128000 上下文长度是总预算,其中包含系统提示词、用户查询、历史对话以及召回内容。召回条数与每段长度共同决定了召回内容占用的 token 量,这个总量不能超过模型的上下文预算。引用上限 128000 token 限制了所有引用内容的总 token 预算,而向量库返回的是固定条数的段落。每段内容的实际 token 数量决定了是引用上限先触顶,还是召回条数先达到上限。当 OceanBase 的索引参数 ef_construction 或 m 调大时,索引构建时间可能增加,但查询召回的准确性和效率会提高,这有助于模型在有限的引用上限内获得更相关的上下文。

容易做错的三处

  • 日志显示 Connection refused 或 Authentication failed:OCEANBASE_URL 中的连接信息(IP、端口、用户名、密码)配置错误。
  • 模型回复内容缺乏相关性或回答不完整:recall_top_k 设置过低或 chunk_size 过大,导致模型获得的有效信息不足。
  • 向量检索耗时过长,导致整个 RAG 流程响应慢:ef_construction 或 m 参数设置不当,未能充分优化索引结构。

怎么确认配好了

  • 执行 FastGPT 知识库测试,观察召回内容是否准确且相关,并检查返回的 token 数量是否在预期范围内。
  • 在 OceanBase 监控平台查看连接数和查询延迟,确保数据库在高并发下仍能稳定运行。
  • 通过 FastGPT 的调试接口,检查模型输入中的引用内容是否符合 quoteMaxToken 的限制,并评估召回条数是否合理。
  • 模拟高负载场景,观察端到端响应时间,确保整个 RAG 流程在业务需求下保持流畅。

参考资料