论文
TrackMAE:通过 Track Mask 和 Predict 进行视频表示学习
TrackMAE: Video Representation Learning via Track Mask and Predict
摘要
掩蔽视频建模(MVM)已成为一种简单且可扩展的自监督预训练范例,但仅隐式编码运动信息,限制了学习表示中时间动态的编码。因此,此类模型难以完成需要细粒度运动感知的以运动为中心的任务。为了解决这个问题,我们提出了 TrackMAE,一种简单的屏蔽视频建模范例,它明确地使用运动信息作为重建信号。在 TrackMAE 中,我们使用现成的点跟踪器来稀疏跟踪输入视频中的点,生成运动轨迹。此外,我们利用提取的轨迹通过运动感知掩蔽策略来改进随机管掩蔽。我们通过提供运动目标形式的补充监督信号来增强在像素和特征语义重建空间中学习的视频表示。我们对不同下游设置的六个数据集进行了评估,发现 TrackMAE 始终优于最先进的视频自监督学习基线,学习更具区分性和通用性的表示。代码可在 https://github.com/rvandeghen/TrackMAE 获取