论文
UniCVR:从统一零样本组合视觉检索的对齐到重新排序
UniCVR: From Alignment to Reranking for Unified Zero-Shot Composed Visual Retrieval
摘要
组合图像检索、多轮组合图像检索和组合视频检索都共享一个共同的范例:将参考视觉与修改文本组合起来以检索所需的目标。尽管有这种共享的结构,但这三个任务都是孤立研究的,之前没有提出统一框架的工作,更不用说零样本解决方案了。在本文中,我们提出了 UniCVR,这是第一个统一的零样本组合视觉检索框架,它联合解决所有三个任务,而无需任何特定于任务的人工注释数据。 UniCVR 战略性地结合了两种互补的优势:用于组合查询理解的多模态 大语言模型 (MLLM) 和用于结构化视觉检索的视觉语言预训练 (VLP) 模型。具体来说,UniCVR 分两个阶段运行。在 Stage~I 中,我们通过对大约 350 万个样本的精选多源数据集进行对比学习,将 MLLM 训练为组合查询嵌入器,从而桥接 MLLM 和冻结的 VLP 图库编码器之间的异构嵌入空间。提出了基于聚类的硬负抽样策略来加强对比监督。在Stage~II中,我们引入了一种MLLM引导的双层重新排名机制,该机制将自适应预算子集评分应用于少量排名靠前的候选者,然后通过双层重新评分方案利用所得的相关性信号,以最小的计算开销产生更准确的最终排名。涵盖所有三项任务的五个基准的广泛实验表明,UniCVR 实现了尖端性能,验证了其有效性和通用性。