论文

从视频中进行结构化动力学的自监督学习

Self-Supervised Learning of Structured Dynamics from Videos

模型训练预训练

摘要

理解视频中的运动是视觉学习的一个基本挑战,因为帧与帧的变化涉及两个动态来源:相机运动和物体运动。这种分解在表示学习中仍未得到充分探索,部分原因是这些因素在自然视频中紧密耦合并且难以单独监督。然而,恢复它对于学习鲁棒的运动表示非常重要,这些运动表示可以将有意义的对象动态与相机引起的变化分开。我们研究是否可以从预训练图像视觉 Transformer 的冻结特征中恢复这种结构化运动表示。我们提出了结构化动态模型(SDM),它通过未来特征预测将时间变化的主要来源与残留动态明确分开,而不是用单个纠缠潜在或非结构化的空间密集转换标记来表示视频变化。训练结合了对真实视频的自监督学习和对合成库布里克数据的场景动态的弱监督。我们在 ProbeMotion 上评估 SDM,这是一个新的评估套件,涵盖具有摄像机运动、物体运动和组合动态的合成视频和真实视频。 SDM 的性能优于使用全局 CLS 或平均池化特征的骨干基线,并且在多个探针上与强监督表示(例如 VGGT)相比,尽管使用的监督要弱得多,但 SDM 的性能优于主干基线。这些结果表明,预训练的图像模型可以很容易地重新用于结构化视频动态表示,为学习和分析潜在视频动态提供有用的归纳偏差。