论文
ELVA:探索排名驱动的通用多模态检索
ELVA: Exploring Ranking-Driven Universal Multimodal Retrieval
摘要
通过对比学习利用多模态 大语言模型 (MLLM) 已成为提高通用多模态检索 (UMR) 性能的主流范例。然而,以前的工作在将对比范式应用于检索任务时忽略了颗粒盲目性。粒度盲目性是指模型倾向于忽略查询中包含的粒度级信息,这对于有效处理复杂查询至关重要。这源于对比学习将样本视为二元分类(正/负),而忽略了每个负样本所携带的不同信息。为了解决这个问题,我们认为应该根据负样本与正样本的相似性来区别对待,使模型能够从每个负样本中学习不同的颗粒信息。在本文中,我们介绍了一个简单但有效的框架,称为 ELVA,这是一种基于规则的新型 RL 框架,可通过排名驱动的 MLLM 来减轻颗粒盲目性。 1)我们不依赖奖励模型,而是将带有可验证奖励的强化学习(RLVR)扩展到检索任务,允许模型在没有明确排名标签的情况下探索新的排名行为。 2)通过利用基于规则的奖励,我们的方法联合优化负样本的排名,同时扩大正负样本之间的相似度差距。为了更精确地衡量粒盲性,我们进一步引入了专门针对多粒查询场景设计的新基准MRBench。 ELVA 在标准检索基准测试中取得了最先进的结果,其在 MRBench 上显着提升了 13.1%,进一步证明了其在缓解谷物盲目性方面的有效性。