模型指南官方文档3 分钟阅读模型组合页

Ernie 32K 上下文 这一档模型配 Milvus 的配置口径

`ernie-4.5-turbo-vl-32k` 模型具备 32000 token 的上下文长度,这意味着一次请求可以包含大量召回内容,为模型提供更丰富的背景信息。引用上限 27000 token 明确了用于引用的内容所能占用的最大 token 预算。段落条数由检索侧决定,与引用上限是两个独立维度。

这一档模型的参数意味着什么

ernie-4.5-turbo-vl-32k 模型具备 32000 token 的上下文长度,这意味着一次请求可以包含大量召回内容,为模型提供更丰富的背景信息。引用上限 27000 token 明确了用于引用的内容所能占用的最大 token 预算。段落条数由检索侧决定,与引用上限是两个独立维度。图片输入功能支持多模态场景,而工具调用功能缺失则表示该模型不直接支持通过工具扩展能力。

配 Milvus 要定哪些

配置项建议取法这样取的依据
MILVUS_ADDRESSmilvus.svc.cluster.local:19530 或公网 IP:端口Milvus 服务部署的实际地址,确保 FastGPT 可以访问
MILVUS_TOKEN按实测标定Milvus 访问凭证,确保认证授权安全
HNSW efConstruction128HNSW 索引构建参数,平衡召回质量与索引速度
HNSW M16HNSW 索引图层参数,影响搜索精度和内存占用
IP (内积)默认向量相似度度量方式,适用于多数文本嵌入场景
召回条数10-15 条结合模型引用上限与单段平均长度,避免超出预算

这两者互相约束的地方

模型上下文长度是总预算,其中一部分要分配给检索到的内容。引用上限按 token 计数,而向量库返回的是固定数量的条目。当单条内容较短时,可以在引用上限内包含更多条目;若单条内容较长,则可能在条目数未达上限时,引用 token 预算已耗尽。因此,需要根据实际文档的平均长度,调整向量检索的召回条数,确保总引用 token 不超过 27000。此外,Milvus 索引参数如 HNSW 的 efConstruction 或 M 值调高,通常会提升检索精度,从而为模型提供更相关的上下文,但也可能增加索引构建时间或内存消耗。

容易做错的三处

  • 日志显示 context window exceeded:原因可能是检索到的总内容 token 数超出了模型的 32000 token 上下文长度。
  • 返回结果中引用内容缺失或不完整:原因可能是引用内容 token 预算 27000 已用尽,导致部分检索到的内容被截断。
  • Milvus 客户端连接超时:原因可能是 MILVUS_ADDRESS 配置错误或网络策略限制了 FastGPT 对 Milvus 服务的访问。

怎么确认配好了

  • 在 FastGPT 界面中,上传少量文档并进行提问,观察返回结果中引用的内容是否完整且相关。
  • 检查 FastGPT 后端日志,确认是否有 Milvus 相关的连接成功或错误信息,以及向量搜索的响应时间。
  • 通过 FastGPT 的调试接口,模拟不同长度的查询和召回内容,观察模型返回的 token 使用情况,以确定引用上限和召回条数的合理范围。

参考资料