模型指南官方文档4 分钟阅读模型组合页

StepFun 64K 上下文 这一档模型配 Milvus 的配置口径

StepFun 64K 上下文模型,其 64000 token 的上下文长度,决定了单次请求中可输入的最大文本量,包括用户提问、历史对话和知识库召回内容。60000 token 的引用上限,则为知识库召回内容设定了硬性天花板,即使向量库返回更多内容,模型也只会处理此上限内的部分。图片输入能力允许模型

这一档模型的参数意味着什么

StepFun 64K 上下文模型,其 64000 token 的上下文长度,决定了单次请求中可输入的最大文本量,包括用户提问、历史对话和知识库召回内容。60000 token 的引用上限,则为知识库召回内容设定了硬性天花板,即使向量库返回更多内容,模型也只会处理此上限内的部分。图片输入能力允许模型处理视觉信息,为多模态应用提供了基础。工具调用能力则意味着模型可以与外部系统交互,执行特定任务,扩展了其应用边界。

配 Milvus 要定哪些

配置项建议取法这样取的依据
MILVUS_ADDRESSyour_milvus_host:19530确保 FastGPT 能够正确连接到 Milvus 实例,19530 是 Milvus 默认端口。
MILVUS_TOKENyour_milvus_api_keyMilvus Cloud 或启用认证的 Milvus 实例需要令牌进行身份验证。
HNSW efConstruction128HNSW 索引构建参数,影响索引质量和构建速度,此值在召回性能和索引时间之间取得平衡。
HNSW M16HNSW 索引图的邻居数量,影响搜索精度和索引大小,此值是常见优化设置。
召回条数10-15 条结合模型引用上限与单段长度,避免单次召回内容超出模型处理能力。
召回段落长度500-800 字符经验值,旨在提供足够信息且不过度稀释上下文,避免长段落浪费 token。

这两者互相约束的地方

StepFun 64K 上下文模型与 Milvus 向量库的配合,核心在于如何有效管理上下文窗口。模型的 64000 token 上下文长度是总容量,知识库召回内容、用户查询和模型回复都需在此限制内。引用上限 60000 token 直接制约了向量库召回内容的最大可用量。这意味着,即使 Milvus 返回了 20 条文档,如果这些文档的总长度超过 60000 token,模型也只会处理其中的一部分。向量库的返回条数应与模型引用上限和每段长度进行权衡,确保 召回条数 × 每段平均长度 不会显著超出 60000 token。Milvus 的索引参数如 HNSW 的 efConstruction 或 M 值调大,可能提升召回精度,但也可能增加查询延迟,进而影响 FastGPT 响应时间。

容易做错的三处

  • 日志显示 Milvus connection failed: Error 10001:通常是 MILVUS_ADDRESS 配置错误或 Milvus 服务未启动。
  • 模型回答缺乏细节或关键信息:召回条数设置过少,或 召回段落长度 过短,导致模型获取的上下文不足。
  • FastGPT 界面提示 Max token limit exceeded:知识库召回内容加上用户输入,总长度超出了 64000 token。

怎么确认配好了

  • 在 FastGPT 管理后台,创建知识库并上传少量文档,进行问答测试,观察模型回答是否能准确引用知识库内容。
  • 检查 FastGPT 容器的日志输出,确认没有 Milvus 相关的连接错误信息。
  • 通过 FastGPT 的调试模式,观察每次请求中知识库召回的条数和总 token 数,验证是否符合预期。

参考资料