论文
掩盖重要的事情:用于自动驾驶的显着性引导视频自监督学习
Mask What Matters: Saliency-Guided Video Self-Supervised Learning for Autonomous Driving
摘要
通过屏蔽时空预测进行视频自监督学习已成为从未标记数据中学习特征表示的有前途的范例。然而,现有的方法通常依赖于随机屏蔽,这会不加区别地删除区域,而不管其语义或时间相关性如何。在以自我为中心的驾驶视频中,这可能会削弱借口信号,因为行人、车辆、车道边界和动态交互等安全关键线索通常只占据画面的一小部分,但却是下游感知的核心。我们推出了 V-JEPA4A,这是用于自动驾驶的 V-JEPA 的领域专用变体,它使用新颖的显着性驱动屏蔽策略对公开的驾驶视频进行了预训练。它解释了语义和时间相关的上下文。所提出的策略根据语义重要性和时间相关性保留和预测上下文,产生更多信息的表示学习,同时保留屏蔽预测的效率。我们在跟踪、语义分割和深度估计等四个驾驶基准上评估最终的编码器。结果表明,与具有随机掩码的 V-JEPA 相比,V-JEPA4A 将 BDD100k MOT 上的身份切换减少了 25%,在 Cityscapes 上实现了 73.2 mIoU,在 KITTI-2015 深度上实现了 3.75 RMSE,同时仅产生约 14% 的额外 预训练 迭代开销。