论文
有限资源下自监督图像和视频预训练的对照研究
A Controlled Study of Self-Supervised Image and Video Pretraining under Limited Resources
摘要
视觉基础模型是图像和视频理解的基石,但通常需要大量数据和计算。当前预训练视觉基础模型所需的规模可能是不可持续或不必要的,当可以用更少的资源获得有效的模型时,就会产生显着的好处。为了更好地了解自监督学习 (SSL) 目标在资源限制下的表现,我们在匹配的数据、架构和计算预算下对图像和视频 SSL 目标进行了受控研究。我们比较对比、重建、特征预测和扩散目标,并在不同的图像和视频理解任务中评估独立和联合训练的图像视频 SSL 公式。我们的结果表明,DINOv2 式的预训练在有限的资源下始终能提供最强的整体性能。此外,将 DINOv2 与 VideoMAE 等视频 SSL 目标相结合可显着提高图像分类和分割性能,但会降低视频跟踪和相机姿态估计性能,揭示语义和几何表示学习之间的重要权衡。这些发现表明,结合图像和视频 SSL 目标在资源有限的环境中可能是有益的,同时强调需要改进方法,以更好地平衡语义、时间和几何监督。