论文

蒙面浪荡公子:利用数据增强来推进自动编码器的自我监督学习

Masked Swingers: Harnessing Data Augmentation to Advance Autoencoders for Self-Supervised Learning

模型训练预训练

摘要

自监督学习 (SSL) 消除了对注释的需求,并且使模型能够比监督学习跨越更多领域。自动编码器 SSL 框架通过在因瓶颈或噪声注入而丢失信息后重建自己的输入来进行学习。屏蔽自动编码器(MAE)是该框架最成功的实例:它们对补丁的随机子集进行编码,然后对屏蔽补丁进行解码。在这项工作中,我们引入了改进 MAE 的关键修改。我们的方法以两种不同的方式增强图像,然后分别对每个视图进行掩码和编码。然后,它在解码屏蔽补丁之前在视图之间交换全局表示(CLS 词元)。根据设计,我们的 Masked Swingers 鼓励学习与视图无关的图像摘要,以促进高效传输。我们进行了大量的实验,发现 Masked Swingers 在 ImageNet-1K kNN 上的表现优于 MAE +3-5%,并且在细粒度任务上提供了巨大的增益,例如,在实例检索上相对增益 +45%,在动物重新 ID 上相对增益 +22%,在 Omniglot 字符识别上相对增益 +76%。首先,在三个新的状态探测数据集上,Swingers 相对于 MAE 减少了 -64% 的误差,为世界建模打开了大门。欢迎来到我们的浪荡公子派对。