结论
FastGPT的图片检索能力依托原有知识库搜索链路,仅增加了图片输入的处理路径,支持文搜图、图搜图、图文混合搜索三种使用场景。其检索效果与模型配置、入库索引生成情况直接相关。
具体怎么做
首先明确两种核心图片处理路径:1. 图片描述检索:配置可用视觉模型后,系统将图片内容转为文本描述,参与普通文本检索;2. 图片向量检索:配置支持图片输入的向量模型后,系统直接为图片生成向量,与知识库中图片向量进行相似度匹配。常见使用方式包含文搜图、图搜图、图文混合搜索。不同模型配置对应不同检索逻辑,具体如下:
| 知识库配置 | 纯文本查询 | 纯图片查询 | 图文混合查询 |
|---|---|---|---|
| 普通向量模型,无视觉模型 | 正常文本检索 | 基本不可用 | 主要使用文字部分 |
| 普通向量模型,有视觉模型 | 正常文本检索 | 图片转描述后参与文本检索 | 文字+图片描述共同检索 |
| 支持图片的向量模型,无视觉模型 | 正常文本检索 | 图片向量检索 | 文本检索+图片向量检索 |
| 支持图片的向量模型,有视觉模型 | 可命中图片描述 | 图片描述+图片向量双路检索 | 文本+图片描述+图片向量多路检索 |
注意事项
图片能否被检索到,需同时满足搜索时上传图片与入库时建立对应索引。图搜图效果不理想时,需确认是否配置了视觉模型或支持图片的向量模型,以及入库时是否生成有效图片索引。检索效果还受图片清晰度、图片内容可被模型理解的程度影响。
来源:FastGPT 官方文档