模型指南官方文档4 分钟阅读模型组合页

Hunyuan 6K 上下文 这一档模型配 Milvus 的配置口径

Hunyuan 6K 上下文模型提供了 6000 token 的输入能力,这直接决定了单次请求中可以包含的指令、历史对话以及知识库召回内容的总体规模。引用上限为 4000 token,意味着即便上下文总容量足够,模型在生成回答时实际能引用的知识库段落总长度也受此限制。模型支持图片输入,可用于多模态场

这一档模型的参数意味着什么

Hunyuan 6K 上下文模型提供了 6000 token 的输入能力,这直接决定了单次请求中可以包含的指令、历史对话以及知识库召回内容的总体规模。引用上限为 4000 token,意味着即便上下文总容量足够,模型在生成回答时实际能引用的知识库段落总长度也受此限制。模型支持图片输入,可用于多模态场景,但工具调用能力缺失,表明在需要外部 API 交互的复杂任务中,需在 FastGPT 平台层面通过其他方式实现。单次最大输出未标注,实际输出长度依赖于模型的内部机制和提示词的引导。

配 Milvus 要定哪些

配置项建议取法这样取的依据
MILVUS_ADDRESSyour_milvus_host:19530FastGPT 连接 Milvus 服务的标准端口。
MILVUS_TOKEN按实测标定Milvus 身份验证凭据,确保安全连接。
index_typeHNSWHNSW 索引在召回性能与精度之间提供良好平衡,适合 RAG 场景。
metric_typeIP内积(IP)相似度度量与大多数文本嵌入模型的输出特性匹配。
top_k5综合考虑召回质量和模型引用上限,初始建议召回前 5 条相关段落。
max_chunk_size800–1200 字符确保单个知识库分段内容充足,同时避免过长导致模型处理效率下降。

这两者互相约束的地方

模型 6000 token 的上下文长度是总预算,知识库召回的条数和每段长度必须在此限制内。例如,当 top_k 设置为 5,每段平均长度为 1000 字符(约 500 token)时,仅知识库召回部分就可能占用 2500 token。这部分加上指令、历史对话等,总和不能超过 6000 token。此外,模型的 4000 token 引用上限意味着,即使 Milvus 返回了大量段落,模型在生成回答时也只会引用其中不超过 4000 token 的内容。Milvus 的索引参数如 HNSW 的 M 和 efConstruction 调大,会提升索引构建时间和查询召回精度,这对于模型理解上下文的质量有正面影响,但不会改变模型的上下文和引用上限。因此,需要平衡 Milvus 的召回能力与模型处理能力,避免无效召回或超出模型处理范围。

容易做错的三处

  • Milvus 连接失败,报错 connection refused。原因:MILVUS_ADDRESS 配置错误或 Milvus 服务未启动。
  • 知识库召回内容与预期不符,返回的 top_k 条目关联性差。原因:嵌入模型与 Milvus 的 metric_type 不匹配,或者 index_type 参数未优化。
  • 模型回答中引用的知识点缺失, despite Milvus 返回了相关内容。原因:知识库召回总 token 量或单条召回 token 量超出模型的引用上限。

怎么确认配好了

  • 在 FastGPT 调试界面,向模型提问知识库中的内容,观察返回的“引用”部分是否包含预期的知识点。
  • 使用 Milvus 客户端工具,通过 embedding 向量直接查询知识库,核对 top_k 返回结果的相似度排序是否合理。
  • 在 FastGPT 日志中检查知识库召回阶段的 token 消耗,与模型的上下文长度和引用上限进行比对,确认在限制范围内。

参考资料