论文

时间机器:论运动的力量实现高效感知

The TIME Machine: On The Power of Motion for Efficient Perception

模型训练预训练

摘要

近年来,视频表示学习取得了巨大进步。这是由许多因素驱动的,包括训练规模和下一帧预测训练的自监督模型的成功。虽然这些因素突破了视频模型的界限,但它们也引入了自身的局限性。首先,缩放视频模型可能会达到令人望而却步的成本,最近的模型需要数百年的视频进行训练。其次,学习预测下一帧(或帧的嵌入)自然会关注空间信息,因此视频模型仍然难以理解时间信息。在本文中,我们提出了一种新颖的方法,该方法使用运动作为缓解这两个核心问题的方式。给定视频中点轨迹形式的运动,我们屏蔽一些轨迹并使用屏蔽自动编码器来重建丢失的轨迹。这使我们能够以自我监督的方式学习表示,我们称之为 TIME(时间信息运动嵌入),并且专注于捕获时间信息。此外,由于运动本质上是外观不变的,所以 TIME 需要更少的例子来很好地概括。因此,在没有任何花里胡哨的情况下,TIME 在时间任务上的表现与最先进的模型相当,使用的训练数据少了 4 个数量级。对于一般任务,TIME 可以与现有表示结合使用,我们观察到它使 V-JEPA 2、RVM 和 VideoMAE 在 SSV2、EgoExo4D 和 Diving48 等标准基准上有了显着改进。这些结果为更具时间意识和更具可扩展性的模型指明了一种新的有前景的视频范例。