这一档模型的参数意味着什么
Hunyuan 模型档位,其 上下文长度 为 224000 token,这直接决定了单次请求中可输入的用户提问、系统指令以及召回内容的上限。超出此长度的输入将被截断或导致模型拒绝响应。单次最大输出 未标注,意味着输出长度可能受限于模型内部设定或可用计算资源,但通常会大于常规对话模型的输出限制。引用上限 224000 意味着在 RAG 场景下,可用于支持回答的引用段落总长度不应超过此值,这与 上下文长度 共同构成了知识召回内容的硬性约束。图片输入 false 和 工具调用 false 则表明此模型不原生支持多模态输入(图像)和函数调用能力,若需实现相关功能,需在 FastGPT 平台层进行前置处理或后置封装。
配 Milvus 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
MILVUS_ADDRESS | your_milvus_host:19530 | 指定 Milvus 服务端的网络地址和端口,确保 FastGPT 能够连接。 |
MILVUS_TOKEN | your_milvus_api_key | 用于 Milvus 服务的认证,保障数据访问安全。 |
HNSW (索引类型) | HNSW | 适用于高维向量高效近似最近邻搜索,平衡了查询速度与召回精度。 |
IP (距离度量) | IP | 内积距离,适用于衡量向量间的相似性,对归一化向量表现良好。 |
| 召回条数 | 5-10 条 | 根据上下文长度与单段平均长度,避免超出模型 引用上限。 |
| 每段长度 | 800-1200 字符 | 结合模型上下文与召回条数,确保单次召回内容有足够的语义完整性。 |
这两者互相约束的地方
Hunyuan 模型的 上下文长度 对 Milvus 的召回策略构成核心约束。召回条数 乘以 每段长度 的总和,必须严格控制在 224000 token 的 上下文长度 预算之内,否则即使 Milvus 返回了大量相关结果,模型也无法完全处理。引用上限 224000 token 与 Milvus 返回的 召回条数 共同决定了实际可用于模型推理的知识段落数量。当 Milvus 返回的条数过多,导致总长度超过 引用上限 时,FastGPT 平台会根据策略进行截断。Milvus 的索引参数,如 HNSW 的 efConstruction 和 M 参数,其调优会影响召回的准确性和速度。若 efConstruction 或 M 设置过高,虽然可能提升召回精度,但会增加 Milvus 的查询延迟,进而可能导致 FastGPT 平台的 RAG 链路响应时间延长,用户体验下降。
容易做错的三处
- 日志显示
Connection refused或Authentication failed:Milvus 连接地址MILVUS_ADDRESS或认证令牌MILVUS_TOKEN配置错误。 - 模型返回的回答不包含知识库引用,或引用内容质量差:Milvus 召回的向量与查询向量匹配度低,可能原因包括向量嵌入模型不匹配,或 Milvus 索引参数
HNSW未充分优化。 - FastGPT 界面显示
上下文长度超出限制:Milvus 召回的召回条数过多,或每段长度过长,导致总输入 token 超过 Hunyuan 模型的 224000上下文长度。
怎么确认配好了
- 在 FastGPT 知识库测试界面,上传文档并进行问答,观察模型能否正确引用知识库内容,并检查引用的内容是否与原始文档相关。
- 检查 FastGPT 后台日志,确认没有 Milvus 连接错误、认证失败或查询超时的相关提示。
- 在 Milvus 监控工具中,观察查询的 P99 延迟,确保其在可接受范围内,以保证 FastGPT 的 RAG 响应速度。
- 通过 FastGPT 的 RAG 调试功能,查看实际传入 Hunyuan 模型的上下文内容,确保召回的
召回条数与每段长度符合预期,且总长度未超出 224000 token 的上下文长度。