论文
ViTAMINS:使用合成硬负片训练自监督视觉 Transformer 的实证研究
ViTAMINS: An Empirical Study of Training Self-Supervised Vision Transformers with Synthetic Hard Negatives
摘要
我们引入了 ViTAMINS,一种将合成硬底片集成到无监督视觉 Transformer 预训练中以提高表示质量的方法。我们的方法完全以 ImageNet 和迁移学习、图像检索、副本检测以及图像、视频分割任务为基准。值得注意的是,我们提出的负数产生了新兴属性,其中学习到的表示包含有关图像语义内容的明确信息,并可作为出色的分类器(比基线高出+11.3%)。 ViTAMINS 通过对现有对比框架进行简单修改来实现这些优势,并在资源效率更高的同时超越竞争方法,例如,我们的 ViT-B 超越了 ViT-L 的 V-JEPA。我们的研究结果促使人们重新考虑对比学习,将其作为主导生成和自我 蒸馏 方法的更简单但更强大的替代方案。