模型指南官方文档4 分钟阅读模型组合页

Siliconflow 128K 上下文 这一档模型配 Milvus 的配置口径

此档模型具备 128000 的上下文长度,决定了单次交互中可以处理的总文本量,包括用户输入、历史对话以及检索召回内容。引用上限为 50000 token,这是用于限制检索内容总量的预算。模型将根据此预算从向量库返回的文档中选择部分内容作为引用。段落条数由检索策略决定,其数量与引用内容的 token

这一档模型的参数意味着什么

此档模型具备 128000 的上下文长度,决定了单次交互中可以处理的总文本量,包括用户输入、历史对话以及检索召回内容。引用上限为 50000 token,这是用于限制检索内容总量的预算。模型将根据此预算从向量库返回的文档中选择部分内容作为引用。段落条数由检索策略决定,其数量与引用内容的 token 预算是两个独立的考量维度。工具调用能力的存在,允许模型在需要时执行外部操作或调用特定功能。不支持图片输入,意味着此档模型不具备处理视觉信息的能力。

配 Milvus 要定哪些

配置项建议取法这样取的依据
MILVUS_ADDRESSlocalhost:19530 或具体 IP 地址确保 FastGPT 能正确连接到 Milvus 服务实例
MILVUS_TOKEN按 Milvus 部署的安全凭证设置用于认证和授权,保障数据访问安全
HNSW M 参数32影响搜索精度与构建效率的平衡,此值在多数场景下提供良好性能
HNSW efConstruction 参数128影响索引构建时的图连接密度,平衡构建速度与查询质量
IP (内积) 向量相似度默认适用于大部分文本嵌入向量的相似度计算场景
检索条数 (topK)5结合模型引用上限与单段内容长度,避免不必要的冗余召回

这两者互相约束的地方

模型的上下文长度是总容量,召回条数与每段内容的长度之积必须在该容量之内。引用上限以 token 为单位,而向量库返回的是固定条数的文档片段。当向量库返回的文档片段较短时,可以在引用上限内包含更多条目;若文档片段较长,则可能在达到引用上限时只引用了较少的条目。因此,检索策略需要平衡返回条数与每条内容的长度,以充分利用模型的引用预算。Milvus 的索引参数如 HNSW 中的 M 和 efConstruction 调大,通常会提升检索的准确性,但也会增加索引构建时间和内存消耗。对于此档模型,高精度的召回有助于更有效地利用其较大的上下文窗口,避免因低质量召回而浪费 token 预算。

容易做错的三处

  • 日志中出现 Milvus connection refused:Milvus 服务未启动或 MILVUS_ADDRESS 配置错误导致连接失败。
  • 模型输出内容与预期引用内容不符,且引用内容明显不足:向量库返回的文档片段过长,导致在达到模型的引用上限时,实际召回的条数过少,未能提供足够的信息。
  • 检索结果长时间无响应或超时:Milvus 索引参数设置不当(如 efConstruction 过大),导致查询性能下降,或 Milvus 实例资源不足。

怎么确认配好了

  • 在 FastGPT 知识库管理界面,测试 Milvus 连接状态,确认显示连接成功。
  • 通过 FastGPT 的调试模式,观察 RAG 链路中传递给模型的引用内容,检查其 token 数量是否接近模型引用上限(50000 token),以及召回的段落条数是否符合预期。
  • 执行一系列具有代表性的查询,检查模型回答中引用的内容是否准确、完整,并与 Milvus 中存储的原始文档进行比对,以评估检索质量。

参考资料