模型指南官方文档4 分钟阅读模型组合页

ChatGLM 200K 上下文 这一档模型配 Milvus 的配置口径

ChatGLM 系列中上下文长度为 200000 的模型,如 `glm-5.1` 和 `glm-4.7`,为 RAG 应用提供了巨大的输入空间。这意味着在单次请求中可以注入大量召回内容,从而支持更复杂的知识检索和问答场景。引用上限同样高达 200000,表明知识库可引用的段落总长度弹性充足。单次最大

这一档模型的参数意味着什么

ChatGLM 系列中上下文长度为 200000 的模型,如 glm-5.1 和 glm-4.7,为 RAG 应用提供了巨大的输入空间。这意味着在单次请求中可以注入大量召回内容,从而支持更复杂的知识检索和问答场景。引用上限同样高达 200000,表明知识库可引用的段落总长度弹性充足。单次最大输出未明确标注,通常由模型生成能力和应用层限制决定。工具调用能力的开箱即用,使得这些模型能够灵活地与外部系统交互,实现复杂业务逻辑。不具备图片输入能力,则表示在设计多模态交互时需要额外处理视觉信息。

配 Milvus 要定哪些

配置项建议取法这样取的依据
MILVUS_ADDRESSyour_milvus_ip:19530Milvus 服务端地址,确保网络可达性。
MILVUS_TOKENyour_api_token用于 Milvus 认证,提高数据安全性。
HNSW M32HNSW 索引参数,平衡召回精度与查询延迟。
HNSW efConstruction128HNSW 索引构建参数,影响索引质量。
IPL2向量相似度度量,适用于大多数通用嵌入模型。
召回条数前 20–50 条兼顾模型上下文限制和召回质量,避免冗余。

这两者互相约束的地方

ChatGLM 200K 上下文档位的模型,其巨大的上下文窗口是与 Milvus 配合时的核心考量。RAG 应用中,召回条数与每段召回内容的长度之积,必须严格控制在 200000 token 的上下文预算之内。如果知识库的引用上限是 200000 token,而 Milvus 返回了大量向量,那么最终能送入模型的文本量将受限于上下文窗口。在实际操作中,是引用上限、模型上下文窗口还是 Milvus 的查询 limit 参数先达到限制,将决定最终的召回效果。Milvus 的索引参数,例如 HNSW 的 M 和 efConstruction,如果设置得过大,会增加索引构建时间和内存消耗,但通常会提升召回的准确性。对于上下文窗口大的模型,高质量的召回能更好地利用其处理能力,避免因低质量召回而浪费上下文资源。

容易做错的三处

  • 返回结果中 text 字段为空,原因是向量库存储的原始文本丢失或映射关系错误。
  • 查询耗时过长,达到 5000ms,原因是 Milvus 索引未优化或硬件资源不足。
  • 模型回答与召回内容无关,原因是向量嵌入质量差导致相似度匹配不准确。

怎么确认配好了

  • 向 FastGPT 平台上传文档后,检查 Milvus 对应集合中是否存在新增向量记录,并通过 count 接口确认数量。
  • 在 FastGPT 知识库管理页面,对特定文档进行检索测试,检查返回的召回内容是否与预期相关,并评估 score 值分布。
  • 通过 FastGPT 的模型调试界面,输入测试问题并观察模型输出,确认是否引用了知识库内容,并检查引用的 text 内容是否完整。
  • 使用 Milvus 客户端直接查询,验证 HNSW 索引在不同 top_k 参数下的查询延迟和召回结果。

参考资料