论文
为大规模图像检索建立多模态语言模型索引
Indexing Multimodal Language Models for Large-scale Image Retrieval
摘要
多模态 大语言模型 (MLLM) 已表现出强大的跨模态推理能力,但其在纯视觉任务中的潜力仍未得到充分开发。我们将 MLLM 作为 无需训练 相似性估计器进行研究,用于实例级图像到图像检索。我们的方法用配对图像提示模型,并将下一个标记概率转换为相似度分数,从而在大规模检索管道中实现零样本重新排序。该设计避免了专门的架构和 微调,利用了在多模式 预训练 过程中学到的丰富的视觉辨别力。我们通过将 MLLM 与内存高效索引和 top-$k$ 候选重新排名相结合来解决可扩展性问题。跨不同基准的实验表明,MLLM 的性能优于其本机域之外的特定于任务的重新排序器,并且对杂乱、遮挡和小对象表现出卓越的鲁棒性。尽管取得了很好的成果,但我们仍确定了严重外观变化下的失效模式,这凸显了未来研究的机会。我们的研究结果将 MLLM 定位为开放世界大规模图像检索的有前途的替代方案。