论文

抑制掩模图像建模表示中的非语义噪声

Suppressing Non-Semantic Noise in Masked Image Modeling Representations

模型评测模型行为与机制分析

摘要

掩模图像建模(MIM)已成为一种普遍存在的自监督视觉范式。在这项工作中,我们表明 MIM 目标会导致学习到的表示保留非语义信息,这最终会损害推理过程中的性能。我们使用主成分分析(PCA)对真实和合成的非语义图像引入了与模型无关的语义不变性评分。基于这个分数,我们提出了一种简单的方法,即语义正交伪影投影(SOAP),来直接抑制补丁表示中的非语义信息,从而在各种基于 MIM 的模型中实现零样本性能的一致改进。 SOAP 是一种事后抑制方法,需要零训练,并且可以作为单个线性头附加到任何模型。