论文

我有一个直播:在连续视频上进行自我监督学习

I Have a Stream: Making Self-Supervised Learning Work on Continuous Video

模型训练预训练

摘要

自我监督学习从婴儿视觉发育中汲取灵感,但标准训练流程与之几乎没有相似之处:图像是独立采样的,并在各个时期进行全局洗牌。我们研究连续视频流的自监督学习,其中使用严格的滑动窗口批次按时间顺序消耗帧,无需全局重新洗牌或多纪元重播。为此,我们构建了 WT++,一个用于流式预训练的 95 小时城市步行游览视频数据集。结合全面的评估套件,我们发现对比法和基于蒸馏的方法在这种情况下很困难,而 MAE 更稳健,但仍然达不到标准 i.i.d。预训练。我们发现,由连续批次之间的滑动窗口消耗引起的批次间高相似性并不能解释这种差距。主要挑战是批次内的高相似性,其中每个批次内的帧几乎是重复的。为了缓解这个问题,我们提出了 StreamMAE,它保留了核心 MAE 重建目标,同时通过流感知正则化和运动偏置裁剪选择来调整输入管道。 StreamMAE 优于流基线,匹配 i.i.d. MAE 在相同的视频数据上进行训练,与 ImageNet 预训练的 MAE 相比仍然具有竞争力,并且随着预训练流从 12 小时增长到 95 小时而积极扩展。