这一档模型的参数意味着什么
Hunyuan 这一档模型具备 256000 的上下文长度,决定了单次请求中可容纳的输入信息总量。单次最大输出未标注,但通常意味着模型在生成回复时受到的长度约束相对宽松。192000 的引用上限,则为知识库召回内容的数量设定了天花板,影响了 RAG 链路中可用于参考的段落总数。工具调用能力的存在,使得模型可以与外部工具集成以执行特定任务,而图片输入为 false 则表明该模型不直接处理图像信息。
配 Milvus 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
MILVUS_ADDRESS | milvus-service:19530 | 生产环境服务发现机制,确保稳定连接。 |
MILVUS_TOKEN | 按实际密钥配置 | Milvus 身份验证凭证,保障访问安全。 |
HNSW | M=32, efConstruction=128 | 平衡召回质量与索引构建速度,适用于中等规模数据。 |
IP | L2 | 适用于文本嵌入向量的相似度计算,L2 距离在语义相似度上表现良好。 |
| 召回条数 | 前 5-8 条 | 结合模型引用上限与单段长度,避免上下文溢出。 |
| 单段长度 | 500-800 字符 | 确保每段信息密度适中,且多段组合后不易超过模型上下文限制。 |
这两者互相约束的地方
Hunyuan 2模型的 256000 上下文长度与 Milvus 的召回结果之间存在直接约束。知识库召回的条数乘以每段的平均长度,必须严格控制在 256000 字符以内,否则模型将无法处理全部输入。同时,Hunyuan 的 192000 引用上限,意味着即使 Milvus 返回了大量相关条目,最终能被模型引用的段落总字符数也受此限制。在实际应用中,RAG 链路的召回条数设定,应同时考虑 Milvus 返回条数与模型的引用上限,取两者中较小者作为有效约束。若 Milvus 的索引参数(如 HNSW 的 efConstruction)调大,虽然可能提升召回精度,但也会增加 Milvus 的查询延迟,这反过来会影响模型等待召回结果的时间,从而影响整体响应速度。
容易做错的三处
- 连接失败,日志显示
Milvus connection refused:通常是MILVUS_ADDRESS配置错误或 Milvus 服务未启动。 - 召回结果为空,但知识库中有相关内容:可能是 Milvus 索引未正确构建,或查询向量与存储向量维度不匹配导致
query_error。 - 模型返回的回答内容过短或不完整:召回的知识段落总字符数接近或超出模型上下文上限,导致模型截断输入。
怎么确认配好了
- 执行一次测试查询,观察 Milvus 返回的
search_result字段是否包含预期向量并具有合理分数。 - 通过 FastGPT 调试界面,检查模型输入中
knowledge_segments字段,确认召回条数和每段内容的完整性。 - 在 Milvus 监控面板上,查看
query_latency和qps指标,确保查询性能符合预期。