模型指南官方文档4 分钟阅读模型组合页

Doubao 256K 上下文 这一档模型配 Milvus 的配置口径

Doubao 这一档模型具备 256000 的上下文长度,这意味着单次请求可以承载大量的输入信息,为复杂的问答和推理提供了充足的空间。引用上限 224000 token,这是模型用于处理引用内容的预算,确保了在生成回答时可以整合丰富的检索结果。工具调用能力允许模型与外部系统交互,扩展了其处理任务的范

这一档模型的参数意味着什么

Doubao 这一档模型具备 256000 的上下文长度,这意味着单次请求可以承载大量的输入信息,为复杂的问答和推理提供了充足的空间。引用上限 224000 token,这是模型用于处理引用内容的预算,确保了在生成回答时可以整合丰富的检索结果。工具调用能力允许模型与外部系统交互,扩展了其处理任务的范围。图片输入功能则支持模型理解和处理视觉信息,使其能够应对多模态场景。

配 Milvus 要定哪些

配置项建议取法这样取的依据
MILVUS_ADDRESShttp://localhost:19530 或具体的 Milvus 服务地址连接到 Milvus 服务实例的入口。
MILVUS_TOKEN按实际部署的认证凭据配置用于 Milvus 服务认证,保障数据安全。
HNSWM=16, efConstruction=200HNSW 索引参数,平衡搜索性能与索引构建时间。M 控制邻居数量,efConstruction 影响构建质量。
IP向量相似度计算方式IP (Inner Product) 适用于度量向量间的相似度,常见于推荐系统。
召回条数5–8 条结合模型引用上限和单段平均 token 数,保证引用内容能被充分利用。
单段最大字符数800–1200 字符避免单段内容过长导致 token 浪费,同时确保信息完整。

这两者互相约束的地方

模型上下文长度是总输入 token 的上限,其中包含了用户查询、系统指令以及检索到的引用内容。当使用 Milvus 进行向量检索时,需要注意召回的段落总 token 数不能超出模型的引用上限。引用上限是模型专门为引用内容预留的 token 预算,它限定了所有引用内容合计能占用的 token 数量。向量库返回的是段落条数,引用内容的实际 token 消耗取决于每段的长度。当每段内容较短时,可以在引用上限内包含更多条目;若每段内容较长,则条目数量会相应减少。Milvus 索引参数的调整,例如 efConstruction 的增大,可能提升召回的准确性,进而为模型提供更相关的上下文,但也会增加索引构建的资源消耗。

容易做错的三处

  • 日志显示 Milvus connection failed: [Errno 111] Connection refused,原因是 MILVUS_ADDRESS 配置错误或 Milvus 服务未启动。
  • 检索结果返回的 hits 列表为空,原因是向量库中没有匹配的向量,或查询向量与索引数据差异过大。
  • 模型输出内容与预期引用内容不符,原因是检索到的段落总 token 数超过了模型的引用上限,导致部分内容被截断或忽略。

怎么确认配好了

  • 在 FastGPT 界面中,通过集成测试功能,验证 Milvus 连接状态显示为“已连接”。
  • 执行一次包含 RAG 流程的对话,检查日志中 Milvus 的查询请求是否成功,以及返回的向量 ID 是否存在。
  • 针对特定查询,观察模型输出中引用内容的完整性,并与 Milvus 检索结果进行比对,确认引用内容与检索到的段落一致。
  • 通过 FastGPT 的 token 统计功能,检查 RAG 流程中引用内容的 token 消耗,确保其在模型的引用上限范围内。

参考资料