模型指南官方文档4 分钟阅读模型组合页

Hunyuan 256K 上下文 这一档模型配 Milvus 的配置口径

Hunyuan 这一档模型具备 256000 的上下文长度,决定了单次请求中可容纳的输入信息总量。单次最大输出未标注,但通常意味着模型在生成回复时受到的长度约束相对宽松。192000 的引用上限,则为知识库召回内容的数量设定了天花板,影响了 RAG 链路中可用于参考的段落总数。工具调用能力的存在,使

这一档模型的参数意味着什么

Hunyuan 这一档模型具备 256000 的上下文长度,决定了单次请求中可容纳的输入信息总量。单次最大输出未标注,但通常意味着模型在生成回复时受到的长度约束相对宽松。192000 的引用上限,则为知识库召回内容的数量设定了天花板,影响了 RAG 链路中可用于参考的段落总数。工具调用能力的存在,使得模型可以与外部工具集成以执行特定任务,而图片输入为 false 则表明该模型不直接处理图像信息。

配 Milvus 要定哪些

配置项建议取法这样取的依据
MILVUS_ADDRESSmilvus-service:19530生产环境服务发现机制,确保稳定连接。
MILVUS_TOKEN按实际密钥配置Milvus 身份验证凭证,保障访问安全。
HNSWM=32, efConstruction=128平衡召回质量与索引构建速度,适用于中等规模数据。
IPL2适用于文本嵌入向量的相似度计算,L2 距离在语义相似度上表现良好。
召回条数前 5-8 条结合模型引用上限与单段长度,避免上下文溢出。
单段长度500-800 字符确保每段信息密度适中,且多段组合后不易超过模型上下文限制。

这两者互相约束的地方

Hunyuan 2模型的 256000 上下文长度与 Milvus 的召回结果之间存在直接约束。知识库召回的条数乘以每段的平均长度,必须严格控制在 256000 字符以内,否则模型将无法处理全部输入。同时,Hunyuan 的 192000 引用上限,意味着即使 Milvus 返回了大量相关条目,最终能被模型引用的段落总字符数也受此限制。在实际应用中,RAG 链路的召回条数设定,应同时考虑 Milvus 返回条数与模型的引用上限,取两者中较小者作为有效约束。若 Milvus 的索引参数(如 HNSW 的 efConstruction)调大,虽然可能提升召回精度,但也会增加 Milvus 的查询延迟,这反过来会影响模型等待召回结果的时间,从而影响整体响应速度。

容易做错的三处

  • 连接失败,日志显示 Milvus connection refused:通常是 MILVUS_ADDRESS 配置错误或 Milvus 服务未启动。
  • 召回结果为空,但知识库中有相关内容:可能是 Milvus 索引未正确构建,或查询向量与存储向量维度不匹配导致 query_error。
  • 模型返回的回答内容过短或不完整:召回的知识段落总字符数接近或超出模型上下文上限,导致模型截断输入。

怎么确认配好了

  • 执行一次测试查询,观察 Milvus 返回的 search_result 字段是否包含预期向量并具有合理分数。
  • 通过 FastGPT 调试界面,检查模型输入中 knowledge_segments 字段,确认召回条数和每段内容的完整性。
  • 在 Milvus 监控面板上,查看 query_latency 和 qps 指标,确保查询性能符合预期。

参考资料