论文
物体概念源于运动
Object Concepts Emerge from Motion
摘要
以对象为中心的视觉表示对于物理世界感知很重要,但现有的视觉预训练方法通常捕获语义类别,而不保留单个实例的身份和连贯性。我们提出了一个受生物学启发的框架,可以从原始视频中学习单个图像的以对象为中心的表示。我们的方法使用运动边界作为对象级分组的来源:现成的光流和聚类产生伪实例掩模,它通过像素级成对度量学习来监督单图像编码器。该框架既不需要人工注释,也不需要相机校准。我们首先从 7,163 小时的驾驶和网络视频中获得 1.95 亿个伪标记帧,然后通过运动验证自我训练将监督范围扩大到 4.21 亿帧,该训练将模型建议与运动证据相结合。我们将编码器训练到 Swin-H,并将学习到的表示提炼成 Swin 主干系列。在单目深度估计、3D 对象检测、3D 占用预测和端到端规划方面,所得模型相对于监督和自监督预训练基线实现了有竞争力或优越的性能,并且在几何和实例敏感任务上具有特别强的迁移能力。这些结果表明,运动衍生监督可以教导静态图像编码器表示视觉实例,为可扩展的视觉预训练提供补充方向。