模型指南官方文档5 分钟阅读模型组合页

Hunyuan 28K 上下文 这一档模型配 Milvus 的配置口径

Hunyuan 28K 上下文模型,其上下文长度为 `28000` token,意味着单次请求中模型可以处理的输入信息总量。这直接决定了知识库召回内容的最大承载量。引用上限同样为 `28000` token,表明了在生成回复时,模型能够引用的知识库段落总长度。该模型不支持图片输入和工具调用,因此基于

这一档模型的参数意味着什么

Hunyuan 28K 上下文模型,其上下文长度为 28000 token,意味着单次请求中模型可以处理的输入信息总量。这直接决定了知识库召回内容的最大承载量。引用上限同样为 28000 token,表明了在生成回复时,模型能够引用的知识库段落总长度。该模型不支持图片输入和工具调用,因此基于此模型构建的应用无法直接处理图像信息,也无法通过模型自动调用外部工具来扩展能力。这些参数共同构成了模型在工程实践中的能力边界和资源消耗预估。

配 Milvus 要定哪些

配置项建议取法这样取的依据
MILVUS_ADDRESSlocalhost:19530默认服务端口,实际部署时应替换为 Milvus 服务地址,确保 FastGPT 能够连接。
MILVUS_TOKEN按实测标定Milvus 启用认证时需提供,格式为 username:password。不配置则默认无认证。
HNSWef=128搜索效率与召回率的平衡点,ef 值越大,搜索精度越高,但延迟增加。
IP启用向量相似度度量方式,适用于需要计算向量内积来衡量相似度的场景。
TOP_K5 条单次向量搜索返回的相似向量数量,直接影响模型可引用的知识段落条数。
CHUNK_SIZE800 字符知识库分段的建议长度,需考虑模型上下文窗口,避免单个 chunk 过长。

这两者互相约束的地方

Hunyuan 28K 上下文模型与 Milvus 结合时,核心约束在于模型上下文长度 28000 token。这意味着 Milvus 返回的召回条数乘以每段的平均字符长度(转换为 token 数)的总和,必须严格控制在 28000 token 之下。模型的引用上限 28000 token 进一步强调了这一点。如果 Milvus 配置的 TOP_K 值过高,导致召回内容超出模型上下文限制,模型可能无法处理所有召回信息,甚至引发截断或错误。此外,Milvus 的索引参数如 HNSW 的 ef 值,若设置得过大,虽然可能提升召回精度,但会增加查询延迟,可能导致模型在等待向量检索结果时出现超时,影响整体用户体验。

容易做错的三处

  • MILVUS_ADDRESS 配置错误,导致 FastGPT 启动时报 Connection refused 或 Deadline Exceeded 错误。
  • 知识库分段 CHUNK_SIZE 过大,或 TOP_K 值设置过高,模型处理时出现 Input context length exceeded 报错。
  • Milvus 服务未启用 IP 相似度计算,导致召回结果与预期不符,表现为相关性差的知识段落被返回。

怎么确认配好了

  • 通过 FastGPT 管理界面,上传测试文档,观察是否能正常分段并嵌入到 Milvus。
  • 在 FastGPT 中进行一次问答,检查模型返回的引用段落是否来自知识库,且内容相关。
  • 查阅 FastGPT 后台日志,确认 Milvus 客户端没有持续性的 RPC error 或 invalid token 警告。

参考资料