模型指南官方文档4 分钟阅读模型组合页

OpenAI 1000K 上下文 这一档模型配 Milvus 的配置口径

上下文长度 1000000 决定了模型单次处理的文本总量上限,包括输入提示词、召回内容和模型生成回答。单次最大输出决定了模型生成回答的长度限制。引用上限 1000000 token 是对引用内容总量的预算,它限制了模型在生成回复时可以参考的引用文本的累计大小。检索系统返回的段落条数与引用上限是两个独

这一档模型的参数意味着什么

上下文长度 1000000 决定了模型单次处理的文本总量上限,包括输入提示词、召回内容和模型生成回答。单次最大输出决定了模型生成回答的长度限制。引用上限 1000000 token 是对引用内容总量的预算,它限制了模型在生成回复时可以参考的引用文本的累计大小。检索系统返回的段落条数与引用上限是两个独立维度。图片输入能力允许模型处理图像信息,工具调用能力则支持模型与外部函数交互,扩展其解决问题的范围。

配 Milvus 要定哪些

配置项建议取法这样取的依据
MILVUS_ADDRESSmilvus-service.default.svc.cluster.local:19530内部集群服务发现地址,保障低延迟连接
MILVUS_TOKEN按实际密钥填写认证凭证,确保访问安全与权限
index_typeHNSWHNSW 索引在稠密向量搜索中兼顾查询效率与召回率
metric_typeIPIP(内积)距离度量适用于衡量文本嵌入向量的语义相似性
ef128影响 HNSW 搜索效率与精度,该值提供良好平衡
search_k前 5 条根据模型引用上限与单段平均长度,优先召回高相关性条目

这两者互相约束的地方

召回条数与每段文本的长度共同决定了总的召回内容量,此总量必须控制在模型的上下文长度预算之内。引用上限是按 token 计算的,而向量库返回的是固定条数的文档段落。当每段文本较短时,可能会在达到引用上限之前,先触及召回条数的限制;反之,若每段文本较长,则可能在达到少数召回条数时,便已耗尽引用上限。索引参数如 HNSW 的 ef 或 M 值调大,会提升 Milvus 在相似度搜索中的召回精度,这意味着模型能获得更相关的引用内容,但也可能增加索引构建时间与存储开销。

容易做错的三处

  • 日志显示 Milvus connection failed: [Error: 13, details: "Failed to connect to server"]:MILVUS_ADDRESS 配置错误或 Milvus 服务未启动。
  • 检索结果返回的条数总是少于预期:向量库查询的 limit 参数被设置过小,或数据量不足。
  • 模型输出内容与引用内容关联度低:索引参数 metric_type 选择不当,未能准确捕获向量间的语义关系。

怎么确认配好了

  • 执行一次包含 Milvus 向量检索的完整对话流程,检查 FastGPT 界面中“引用内容”是否成功显示。
  • 通过 Milvus 客户端工具,验证 MILVUS_ADDRESS 和 MILVUS_TOKEN 配置后,能否正常连接并执行向量查询。
  • 在 FastGPT 知识库管理页面,观察知识库分段后的平均 token 数,并以此为基准,判断单次查询返回的条数是否合理,以避免超出模型引用上限。

参考资料