模型指南官方文档4 分钟阅读模型组合页

StepFun 256K 上下文 这一档模型配 openGauss 的配置口径

StepFun 提供的 256K 上下文模型,其 `maxContext` 达 256000 token,这决定了单次交互中可以处理的最大输入信息量,包括用户查询和检索到的知识内容。模型单次最大输出未标注,通常意味着其输出长度受限于整体上下文或内部限制。`quoteMaxToken` 为 24000

这一档模型的参数意味着什么

StepFun 提供的 256K 上下文模型,其 maxContext 达 256000 token,这决定了单次交互中可以处理的最大输入信息量,包括用户查询和检索到的知识内容。模型单次最大输出未标注,通常意味着其输出长度受限于整体上下文或内部限制。quoteMaxToken 为 240000 token,此参数严格限制了引用内容所能占据的 token 总量。检索系统返回的段落条数与 quoteMaxToken 是两个独立的概念,引用上限衡量的是引用内容的总 token 预算。此档模型支持工具调用,使得 Agent 能够执行外部操作;不支持图片输入,因此无法直接处理图像数据。

配 openGauss 要定哪些

配置项建议取法这样取的依据
OPENGAUSS_URLpostgresql://user:password@host:port/dbname标准 PostgreSQL 连接字符串格式,指向 openGauss 实例
ef_construction100影响索引构建时的图连接数量,数值越大索引质量越高,但构建时间增加
ef_search60影响查询时的图遍历范围,数值越大召回率越高,但查询延迟增加
m32HNSW 索引中每个节点的最大连接数,影响索引结构和查询性能
召回条数8结合模型引用上限和单段平均长度,平衡召回质量与 token 消耗
单段最大长度500 字符确保单段内容具有完整语义,并避免单段过长导致 token 浪费

这两者互相约束的地方

StepFun 256K 上下文模型与 openGauss 向量库的集成,需要密切关注两者之间的约束。模型上下文预算是 256000 token,这意味着从 openGauss 检索并传入模型的总内容(召回条数乘以每段长度的 token 数)不能超过此上限。模型的 quoteMaxToken 参数是 240000 token,这是对引用内容的总 token 预算限制。openGauss 向量库返回的是固定数量的段落条数,而每一段的长度是可变的。因此,是 quoteMaxToken 先触顶,还是召回条数达到上限,取决于每段内容的平均 token 长度。如果 openGauss 的索引参数,例如 ef_construction 或 ef_search 被调大,通常意味着向量检索的精度或召回率会提高,可能导致检索到更多相关性高的段落,这需要系统在将这些段落送入模型前进行更精细的 token 预算管理,以避免超出模型的引用上限。

容易做错的三处

  • 错误信息显示 Context window exceeded:原因在于从 openGauss 检索到的内容总 token 数,加上用户查询,超过了模型的 maxContext。
  • 模型回答中引用内容不完整或缺失:原因在于 quoteMaxToken 设置过低,导致即使检索到多条相关段落,也只能引用其中一部分。
  • 查询响应时间过长,甚至超时:原因可能是 openGauss 的 ef_search 参数设置过大,导致查询时需要遍历的节点过多,或者 openGauss 实例资源不足。

怎么确认配好了

  • 对典型业务问题进行多次查询,检查模型返回的引用内容是否完整、准确,并核对日志中 input_tokens 和 output_tokens 字段,确认未超出模型限制。
  • 在 FastGPT 知识库管理界面,调整单段最大长度和召回条数,观察模型回答质量与引用情况的变化,找到平衡点。
  • 监控 openGauss 数据库的 CPU、内存和 I/O 使用率,确保在压力测试下性能稳定,查询延迟在可接受范围内。
  • 通过 FastGPT 的调试工具,查看每次检索的原始结果和最终传递给模型的引用内容,比对 quoteMaxToken 的实际消耗。

参考资料