论文

SpatialVAM:空间感知多视图视频扩散作为数据高效的机器人策略

SpatialVAM:Spatial-Aware Multi-View Video Diffusion as a Data-Efficient Robot Policy

摘要

机器人操纵需要了解环境的 3D 空间结构及其时间演变,但大多数现有政策忽略了一个或两个方面。它们通常依赖于 2D 视觉观察或在静态图像-文本对上进行预训练的主干网,这导致数据要求很高并且对环境动态的理解有限。为了解决这个问题,我们引入了 SpatialVAM,这是第一个同时预测空间感知多视图热图视频和 RGB 视频的 3D 视频动作模型。我们的主要见解是,这种设计自然地将 3D 信息注入视频基础模型,同时调整视频预训练和动作微调之间的表示格式。大量实验表明 SpatialVAM 能够实现数据高效、稳健、可推广和可解释的操作。只需十个演示轨迹并且无需额外的预训练,SpatialVAM 即可处理具有挑战性的长期和接触丰富的任务,泛化到分布外设置,并预测现实的未来视频。对 Meta-World (22\%$\uparrow$)、RoboCasa (15\%$\uparrow$) 和现实世界机器人平台 (16\%$\uparrow$) 的评估表明,SpatialVAM 始终优于其他视频动作模型、视觉语言动作模型和基于 3D 的策略,在数据高效的多任务操作方面建立了新的最先进技术。