模型指南官方文档4 分钟阅读模型组合页

ChatGLM 1000K 上下文 这一档模型配 Milvus 的配置口径

`glm-4-long` 模型,其上下文长度高达 1,000,000 token,赋予了处理超长文本和多轮复杂对话的能力。这意味着在知识库检索场景下,可以一次性注入大量召回内容,减少分批请求的必要性。引用上限 900,000 token 则明确了模型在生成回复时,可以从知识库中引用的最大文本量,这直

这一档模型的参数意味着什么

glm-4-long 模型,其上下文长度高达 1,000,000 token,赋予了处理超长文本和多轮复杂对话的能力。这意味着在知识库检索场景下,可以一次性注入大量召回内容,减少分批请求的必要性。引用上限 900,000 token 则明确了模型在生成回复时,可以从知识库中引用的最大文本量,这直接影响了知识库段落的召回策略。模型未明确标注单次最大输出,通常意味着其输出长度受限于总上下文长度,或有内部动态调整机制。此外,图片输入 false 和 工具调用 false 表明该模型不直接支持图像作为输入或执行外部工具函数,因此在构建 RAG 系统时,需要额外处理多模态输入和复杂业务逻辑集成。

配 Milvus 要定哪些

配置项建议取法这样取的依据
MILVUS_ADDRESSmilvus-service:19530Milvus 服务的默认访问地址,需根据实际部署调整。
MILVUS_TOKEN按实测标定Milvus 访问凭证,确保连接安全。
index_typeHNSW高效的近似最近邻搜索算法,适用于大规模向量检索,平衡召回率与查询速度。
metric_typeIP内积距离,适用于文本嵌入向量,表示向量间的相似度。
nprobe32HNSW 索引的搜索参数,影响搜索精度和速度,通常在 16 到 64 之间调整。
ef500HNSW 索引的构建参数,影响索引质量和查询性能,建议根据数据集规模和查询需求调整。

这两者互相约束的地方

模型 1,000,000 token 的上下文长度为 Milvus 召回结果的承载量提供了上限。当从 Milvus 检索到知识段落时,这些段落的总长度(召回条数 × 每段长度)必须小于模型的上下文长度。同时,模型的引用上限 900,000 token 决定了实际用于回答生成的知识内容不能超出此范围,即使 Milvus 返回了更多内容。这意味着在配置 Milvus 的召回条数时,需要综合考虑单段平均长度和模型的引用上限,避免检索过多的冗余信息。此外,Milvus 索引参数如 ef 调大,通常会提升召回精度,这对于需要高准确性知识引用的 glm-4-long 模型是有益的,但同时也会增加索引构建和查询的计算开销。向量库返回的段落数量和质量,直接影响了模型能否充分利用其长上下文能力,生成相关且准确的回复。

容易做错的三处

  • 日志中出现 Milvus connection failed: [ErrCode: 0, ErrMsg: fail to connect to server]:原因在于 MILVUS_ADDRESS 配置错误或 Milvus 服务未正常运行。
  • 模型回复中知识点缺失,但知识库中明明存在相关信息:原因在于 Milvus 召回条数过少或 nprobe、ef 参数设置不当,导致相关向量未被检索到。
  • RAG 流程中模型输出内容被截断,或提示 context window exceeded:原因在于 Milvus 召回的段落总长度,加上用户输入和系统提示语,超出了 glm-4-long 的 1,000,000 token 上下文长度。

怎么确认配好了

  • 在 FastGPT 知识库管理界面,上传测试文档,并观察 Milvus 对应 collection 中向量数量是否增加。
  • 通过 FastGPT 的 RAG 调试功能,输入与知识库内容相关的查询,检查 Milvus 返回的原始段落内容是否包含预期信息。
  • 使用 FastGPT 的模型测试功能,在开启知识库引用后,观察模型生成的回答中是否包含来自知识库的准确引用,并检查引用内容与 Milvus 召回段落的一致性。
  • 持续监控 Milvus 服务的 CPU、内存、QPS 等指标,确保在实际负载下系统运行稳定,查询延迟在可接受范围内。

参考资料