论文

CLIP 是斗鸡眼吗?揭示和减轻 CLIP 系列中的中心偏差

Is CLIP Cross-Eyed? Revealing and Mitigating Center Bias in the CLIP Family

模型评测模型行为与机制分析

摘要

最近的研究表明,对比视觉语言模型(例如 CLIP)通常缺乏对视觉内容的细粒度理解。虽然越来越多的工作试图解决这一限制,但我们在 CLIP 系列中发现了一种独特的故障模式,我们称之为中心偏差,即使在最近的模型变体中,这种模式仍然存在。具体来说,CLIP 倾向于不成比例地关注图像的中心区域,而忽略位于边界附近的重要对象。这种限制是根本性的,因为无法识别相关对象使得执行依赖于这些对象的任何复杂任务变得困难。为了了解限制的根本原因,我们从代表性和注意力的角度进行分析。使用可解释性方法,即嵌入分解和注意力图分析,我们发现相关概念,尤其是与偏离中心对象相关的概念,由于视觉嵌入聚合过程中的信息丢失,特别是与偏离中心对象相关的概念,从最终表示中的模型嵌入中消失,特别是对池化机制的依赖。最后,我们表明,可以通过 无需训练 策略来缓解这种偏差,例如通过将模型的注意力重定向到偏离中心区域的视觉提示和注意力重新分配。