论文
物以类聚:通过 VLM 中的线性结构实现背景不变的表示
Birds of a Feather Flock Together: Background-Invariant Representations via Linear Structure in VLMs
摘要
视觉语言模型 (VLM),例如 CLIP 和 SigLIP 2,广泛用于图像分类,但它们的视觉编码器仍然容易受到系统偏差的影响,从而破坏鲁棒性。特别是,前景对象与其背景之间的相关性构成了一类显着且实际上重要的虚假依赖关系。在这项工作中,我们重新审视了 VLM 嵌入空间中众所周知的高线性可加性属性,并表明它能够将场景表示分解为前景和背景组件。利用这种洞察力,我们引入了一种 预训练 方法,该方法利用此属性使用合成数据构建背景不变的表示。据我们所知,我们的方法在完美 ($100\%$) 虚假相关性(即训练数据中没有少数群体示例)下,在水鸟上实现了超过 $90\%$ 的第一个最差组准确度。此外,它表现出强大的模拟到真实的传输能力,并且不需要访问现实世界的去偏数据,这使其适用于现实世界的部署。