论文

图像分类器是高效的自监督视频表示学习器

Image Classifiers are Efficient Self-Supervised Video Representation Learners

模型训练预训练

摘要

我们介绍了 VideoMSN,这是一种 Masked Siamese Network 框架,用于在视频中进行高效的自监督时空表示学习。我们不再依赖繁重的 3D 架构或基于重建的自动编码器来学习未标记的数据,而是通过将视频表示为超级图像来重新利用标准图像视觉Transformer,超级图像是由视频采样的帧组成的网格。从每个超级图像中,我们构建两个视图:一个具有空间补丁掩蔽,另一个具有时间帧掩蔽,确保跨帧没有信息泄漏。共享的 Vision Transformer (ViT) 编码器使用 masked Siamese 损失来对齐它们的嵌入,无需重建即可捕获运动和外观线索。我们的无解码器公式利用图像基础模型来实现高效的视频表示学习。从预训练的 DINO-v3 和 DeiT-v3 图像编码器开始,VideoMSN 在 Kinetics-400、UCF101 和 HMDB51 上实现了最先进的性能,同时与之前的视频自监督学习方法相比,所需的视频预训练周期分别减少了 32 倍和 160 倍。我们提出的方法还在低样本分类中表现出强大的性能,证实了学习表示在标签稀缺场景中的可转移性。项目页面:https://cvir.github.io/projects/videomsn.