论文

用于视觉运动控制的对比动作图像 预训练

Contrastive Action-Image Pre-training for Visuomotor Control

模型训练预训练

摘要

现有的机器人视觉编码器面临一个根本瓶颈:机器人数据集缺乏大规模 预训练 所需的规模。之前的工作通过转向互联网规模的图像和语言数据或以自我为中心的人类视频来规避这种数据稀缺性。虽然这些模型显示出前景,但这两种范式都无法从配对的视觉和行动数据中学习,而这是下游视觉运动控制政策所需要的。然而,机器人轨迹(这种配对信号的最直接来源)在 预训练 尺度上不可用,这促使我们从丰富的人类视频中提取动作信号。为此,我们引入了 CAIP(对比动作图像 预训练),这是一种视觉编码器,它将大规模自我中心视频中的人类手部姿势视为末端执行器动作的代理。通过提取 3D 手部关键点(一种与下游机器人动作空间自然对齐的表示),CAIP 通过对比目标学习统一的动作图像表示。 CAIP 利用 32,041 小时的以自我为中心的人类视频和仅 88 小时的机器人操作数据,其性能优于最先进的视觉编码器,包括 DINOv2、SigLIP、MVP 和 R3M。使用 Dexmate Vega 和 Sharpa Wave 手对具有挑战性的现实世界灵巧操作设置进行评估,CAIP 在涉及折叠、浇注和细粒度操作的任务中获得超过 30% 的性能提升。我们的结果表明,我们以对比动作为中心的 预训练 方法提供了一条可扩展的路径,以实现更适合物理交互的稳健视觉表示。