模型指南官方文档4 分钟阅读模型组合页

ChatGLM 200K 上下文 这一档模型配 Milvus 的配置口径

`glm-5v-turbo` 模型系列以其强大的上下文处理能力著称。上下文长度 200000 意味着模型在单次调用中可以处理极长的输入文本,这为 RAG 应用提供了充足的召回内容空间,能够纳入更丰富的背景信息。引用上限 200000 token 明确了模型在生成回复时,可以从召回内容中引用的最大 t

这一档模型的参数意味着什么

glm-5v-turbo 模型系列以其强大的上下文处理能力著称。上下文长度 200000 意味着模型在单次调用中可以处理极长的输入文本,这为 RAG 应用提供了充足的召回内容空间,能够纳入更丰富的背景信息。引用上限 200000 token 明确了模型在生成回复时,可以从召回内容中引用的最大 token 预算。段落条数由检索系统决定,与引用上限是两个独立的量。图片输入能力允许模型理解并处理视觉信息,为多模态 RAG 场景开辟了可能。工具调用功能则赋予模型执行外部动作的能力,使其能与外部系统集成,扩展其应用边界。

配 Milvus 要定哪些

配置项建议取法这样取的依据
MILVUS_ADDRESSlocalhost:19530 或 cloud.milvus.io:19530访问 Milvus 服务的端点,需确保网络可达
MILVUS_TOKENBearer YOUR_API_KEY用于 Milvus Cloud 或启用认证的 Milvus 实例,确保访问权限
index_typeHNSWHNSW 索引在召回效率和精度之间取得良好平衡,适合大规模向量检索
metric_typeIPIP (Inner Product) 距离与大多数嵌入模型的相似度计算方式匹配,提高相关性
nprobe32影响 HNSW 索引的搜索精度和速度,32 是一个兼顾性能的常用值
k前 5 条召回结果数量,与模型引用能力和业务需求相关,需实测标定

这两者互相约束的地方

glm-5v-turbo 的 200K 上下文长度为整合 Milvus 检索结果提供了广阔空间。当 Milvus 返回多个段落时,这些段落的总长度与模型的上下文预算直接相关。召回条数与每段文本的平均长度共同决定了总的召回内容 token 数量,这一总量必须控制在模型的上下文长度之内。引用上限是模型从召回内容中提取信息时的 token 预算。向量库返回的是固定数量的条目,而模型引用时按 token 计数,具体谁先触及上限,取决于每个召回段落的平均长度。当 Milvus 的 HNSW 索引参数(如 nprobe 或 efConstruction)被调大时,通常会提高召回精度,这意味着模型能获得更相关、更高质量的输入,从而可能提升回答的准确性和深度。

容易做错的三处

  • 请求 Milvus 返回状态码 503 Service Unavailable:Milvus 服务未启动或网络配置错误。
  • 模型返回的回答中未包含预期引用内容:Milvus 召回条数过少或引用上限过低,导致模型无法获取足够信息。
  • 调用模型时出现 context_length_exceeded 错误:Milvus 召回内容总长度超出模型上下文限制。

怎么确认配好了

  • 验证 Milvus 客户端能够成功连接到 MILVUS_ADDRESS 指定的服务端,并能执行向量插入和查询操作。
  • 在测试环境中,使用代表性的查询语句在 Milvus 中进行检索,并检查返回的 k 条结果是否符合预期相关性。
  • 提交包含 Milvus 召回结果的完整上下文到模型,观察模型输出的回答是否包含对召回内容的引用,并检查引用内容的总 token 数是否在引用上限之内。

参考资料