模型指南官方文档4 分钟阅读模型组合页

StepFun 128K 上下文 这一档模型配 Milvus 的配置口径

StepFun 128K 上下文模型,其上下文长度为 128000 Token,意味着模型单次处理的输入与输出总和上限。这直接限制了召回内容的总量,以及问题描述、指令等附加信息的空间。引用上限 128000 Token 则决定了知识库召回的段落总和不能超过这一数值。模型不支持图片输入,因此无法直接处

这一档模型的参数意味着什么

StepFun 128K 上下文模型,其上下文长度为 128000 Token,意味着模型单次处理的输入与输出总和上限。这直接限制了召回内容的总量,以及问题描述、指令等附加信息的空间。引用上限 128000 Token 则决定了知识库召回的段落总和不能超过这一数值。模型不支持图片输入,因此无法直接处理图像内容,相关场景需要额外的前置处理。工具调用功能同样缺失,意味着该模型无法直接与外部API进行交互以执行特定任务,需要通过Agent编排层来实现。

配 Milvus 要定哪些

配置项建议取法这样取的依据
MILVUS_ADDRESSyour_milvus_host:19530连接 Milvus 服务的标准地址与端口
MILVUS_TOKENyour_milvus_api_key访问 Milvus Cloud 或启用认证的 Milvus 实例所需凭证
HNSWM=32, efConstruction=200HNSW 索引参数,平衡查询性能与索引构建时间
IPL2向量距离度量,L2 适用于密集向量,与大多数模型嵌入兼容
召回条数前 5-10 条经验值,平衡召回精度与模型上下文消耗
每段召回长度800-1200 字符确保单段信息完整,同时避免过长导致上下文溢出

这两者互相约束的地方

模型的 128000 Token 上下文长度是核心约束。这意味着知识库召回的“召回条数 × 每段长度”不能超过这个总和,同时还要为用户问题、系统指令和模型回答预留空间。Milvus 返回的向量条数与模型实际引用的知识段落数量之间存在联动。即使 Milvus 配置返回了大量结果,如果模型侧的引用上限(128000 Token)先达到,多余的召回内容也不会被利用。此外,Milvus 的索引参数,如 HNSW 中的 efConstruction 值调大,能够提升召回的准确性,但会增加索引构建时间;对于 step-1-128k 这类上下文容量较大的模型,更准确的召回能更好地利用其处理长文本的能力,但也可能因为召回条数过多而触及模型上下文上限。

容易做错的三处

  • 日志中出现 Milvus connection failed: [Errno 111] Connection refused 错误,通常是 MILVUS_ADDRESS 配置错误或 Milvus 服务未运行。
  • 模型返回的回答内容与知识库内容无关,但知识库召回结果不为空,这可能是 Milvus IP 距离度量与嵌入模型不匹配,导致相似性计算偏差。
  • 模型输出截断或报错 Context window exceeded,界面显示召回条数正常但每段召回长度过长,未考虑到总上下文限制。

怎么确认配好了

  • 执行一次包含知识库查询的对话,检查 Milvus 日志中是否有查询请求到达,并记录查询延迟。
  • 在 FastGPT 界面查看“引用内容”或“召回内容”,确认返回的知识段落数量与预期一致,且内容与用户问题相关。
  • 针对不同长度的用户问题和召回配置,通过多次测试,观察模型是否能完整利用召回内容进行回答,并据此确定召回条数与每段长度的合格阈值。
  • 修改 HNSW 索引参数,重建索引后,再次进行知识库查询,对比查询准确率和响应时间的变化,找到适合当前数据集的平衡点。

参考资料