论文

无需训练 使用扩散模型和多模态进行合成图像检索的伪融合 大语言模型

Training-Free Pseudo-Fusion for Composed Image Retrieval with Diffusion Models and Multimodal Large Language Models

摘要

组合图像检索 (CIR) 是基于内容的图像检索中的新兴范例,它使用户能够通过将参考图像与通常基于文本的辅助模态相结合来制定组合查询。这种方法支持细粒度搜索,其中目标图像与用户提供的图像共享结构元素,同时合并辅助文本指定的修改。传统的 CIR 方法依靠多模态融合将视觉和文本特征组合到联合查询嵌入中,这需要将组合查询与目标对齐的训练模块。在这项工作中,我们提出了 PeFuse(用于伪融合),这是一个 无需训练 框架,它利用预训练的扩散模型和多模态 大语言模型 通过生成转换来桥接模态。我们引入了两种新颖的策略:单向和双向转换,将 CIR 转换为四个单模态检索问题。这些方法将 CIR 重新表述为模内或跨模态单查询检索任务,从而绕过了专门的特定任务训练的需要。标准基准的大量实验表明,将 CIR 转换为文本到图像检索任务比其他转换策略更有效,与最先进的方法相比,实现了具有竞争力或优越的性能,同时由于转换管道的可替换组件而保持了高度灵活性。这些结果凸显了零样本 CIR 伪融合范式的有效性。我们的代码公开于:https://github.com/StevenXuf/PeFuse4CIR。