论文

TDV:以时间差分学习更少依赖强假设的视觉表示

You Don't Need Strong Assumptions: Visual Representation Learning via Temporal Differences

模型训练预训练

摘要

人工智能的进步很大程度上是由假设较少的方法推动的。随着计算和数据的增加,归纳偏差较弱的方法通常优于假设较强的方法。这是视觉表示学习领域的一个特别特征,该领域的方法已经从监督学习占主导地位,到弱监督学习,再到现在广泛成功的无需人类标签的自我监督学习。然而,即使是现代的自我监督学习方法仍然依赖于强烈的归纳偏差,例如增强、屏蔽或裁剪。如果这种趋势持续下去,即使是这些剩余的偏差也应该成为大规模的瓶颈——我们的实验证实了这一点:归纳偏差的最佳强度随着数据的增长而降低。这促使人们寻找依赖较少假设的方法。为此,我们引入了视觉时间差异(TDV),这是一种从视频中进行自我监督学习的新范式,它避免了现有的归纳偏差,而是依赖于过去导致未来的因果假设。 TDV 通过联合训练图像编码器和运动编码器来发挥作用,以便当前帧的表示加上编码的运动等于下一帧的表示。尽管没有利用任何强归纳偏差,TDV 仍然在密集空间任务上匹配了最先进的方法,为无需强假设的表示学习奠定了基础。