这一档模型的参数意味着什么
Doubao 这一档模型具备 256000 的上下文长度,这意味着单次请求可以承载大量的输入信息,为复杂的问答和推理提供了充足的空间。引用上限 224000 token,这是模型用于处理引用内容的预算,确保了在生成回答时可以整合丰富的检索结果。工具调用能力允许模型与外部系统交互,扩展了其处理任务的范围。图片输入功能则支持模型理解和处理视觉信息,使其能够应对多模态场景。
配 Milvus 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
MILVUS_ADDRESS | http://localhost:19530 或具体的 Milvus 服务地址 | 连接到 Milvus 服务实例的入口。 |
MILVUS_TOKEN | 按实际部署的认证凭据配置 | 用于 Milvus 服务认证,保障数据安全。 |
HNSW | M=16, efConstruction=200 | HNSW 索引参数,平衡搜索性能与索引构建时间。M 控制邻居数量,efConstruction 影响构建质量。 |
IP | 向量相似度计算方式 | IP (Inner Product) 适用于度量向量间的相似度,常见于推荐系统。 |
| 召回条数 | 5–8 条 | 结合模型引用上限和单段平均 token 数,保证引用内容能被充分利用。 |
| 单段最大字符数 | 800–1200 字符 | 避免单段内容过长导致 token 浪费,同时确保信息完整。 |
这两者互相约束的地方
模型上下文长度是总输入 token 的上限,其中包含了用户查询、系统指令以及检索到的引用内容。当使用 Milvus 进行向量检索时,需要注意召回的段落总 token 数不能超出模型的引用上限。引用上限是模型专门为引用内容预留的 token 预算,它限定了所有引用内容合计能占用的 token 数量。向量库返回的是段落条数,引用内容的实际 token 消耗取决于每段的长度。当每段内容较短时,可以在引用上限内包含更多条目;若每段内容较长,则条目数量会相应减少。Milvus 索引参数的调整,例如 efConstruction 的增大,可能提升召回的准确性,进而为模型提供更相关的上下文,但也会增加索引构建的资源消耗。
容易做错的三处
- 日志显示
Milvus connection failed: [Errno 111] Connection refused,原因是MILVUS_ADDRESS配置错误或 Milvus 服务未启动。 - 检索结果返回的
hits列表为空,原因是向量库中没有匹配的向量,或查询向量与索引数据差异过大。 - 模型输出内容与预期引用内容不符,原因是检索到的段落总 token 数超过了模型的引用上限,导致部分内容被截断或忽略。
怎么确认配好了
- 在 FastGPT 界面中,通过集成测试功能,验证 Milvus 连接状态显示为“已连接”。
- 执行一次包含 RAG 流程的对话,检查日志中 Milvus 的查询请求是否成功,以及返回的向量 ID 是否存在。
- 针对特定查询,观察模型输出中引用内容的完整性,并与 Milvus 检索结果进行比对,确认引用内容与检索到的段落一致。
- 通过 FastGPT 的 token 统计功能,检查 RAG 流程中引用内容的 token 消耗,确保其在模型的引用上限范围内。