这一档模型的参数意味着什么
Hunyuan 32K 这一档模型,其 32000 token 的上下文长度(maxContext)决定了单次交互中模型可处理的总信息量,包括用户输入、历史对话以及引用内容。引用上限(quoteMaxToken)为 20000 token,这限制了模型在生成回复时可参考的引用内容总量。引用上限是引用内容合计占用的 token 预算,而段落条数由检索侧的返回条数决定。单次最大输出未标注,通常由模型或平台默认值控制。图片输入和工具调用功能在此档模型中未开放,因此无法通过这些通道扩展模型能力。
配 Milvus 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
MILVUS_ADDRESS | 127.0.0.1:19530 | Milvus 服务部署的实际地址和端口 |
MILVUS_TOKEN | 按实测标定 | 用于 Milvus 认证的 API 密钥,保障访问安全 |
index_type | HNSW | HNSW 索引类型在检索性能和准确性上表现均衡 |
metric_type | IP | IP(内积)距离度量适用于多数文本嵌入场景 |
| 召回条数 | 10-15 条 | 结合引用上限和单段长度,保证有效信息召回 |
| 单段最大字符数 | 800-1200 字符 | 兼顾信息完整性和模型上下文处理效率 |
这两者互相约束的地方
Hunyuan 32K 上下文模型与 Milvus 向量库的配合需精细考量。召回条数与每段长度的乘积不应超过模型的上下文预算,否则可能导致截断或信息丢失。引用上限按 token 计,而向量库返回的则是按条数计,具体谁先达到限制取决于每段内容的平均 token 长度。如果每段内容较长,引用上限可能先触顶;若每段内容较短,召回条数则可能成为瓶颈。当 Milvus 的索引参数(如 ef 或 M for HNSW)调大时,通常意味着更高的检索精度,这会为模型提供更相关的引用内容,但也可能增加检索时间。模型能处理的上下文长度决定了它能利用这些高精度召回信息的程度。
容易做错的三处
- 连接 Milvus 超时:
MILVUS_ADDRESS配置错误或网络不通导致连接失败。 - 检索结果为空:
MILVUS_TOKEN无效或集合权限不足,导致无法查询数据。 - 引用内容被截断:召回条数或每段长度设置过高,超出
quoteMaxToken限制,导致部分引用内容未被模型处理。
怎么确认配好了
- 检查 Milvus 连接状态:在 FastGPT 平台配置界面,查看 Milvus 服务连接状态是否显示“已连接”。
- 执行一次 RAG 查询:发起一次包含知识库的对话,观察日志中是否有 Milvus 检索成功的记录。
- 核对引用内容完整性:检查模型返回的引用内容是否与 Milvus 检索到的原文一致,无明显截断,且引用 token 总量在
quoteMaxToken限制内。