论文

GALA:跨实施例的视觉-语言-动作模型预训练的几何感知潜在动作建模

GALA: Geometry-Aware Latent Action Modeling for Vision-Language-Action Model Pretraining across Embodiments

模型训练预训练

摘要

由于末端执行器的动作空间异构,从多实施数据集中学习大规模视觉语言动作(VLA)模型仍然具有挑战性。尽管潜在动作模型 (LAM) 可以从不同的视频数据中学习与具体实施例无关的动作表示,但现有的基于图像的 LAM 通常无法捕获细粒度的末端执行器关节,特别是人类和灵巧的机器人手的手指级几何变化。为了解决这个限制,我们提出了 GALA,一种几何感知的潜在动作建模框架,它通过 3D 末端执行器几何运动增强基于图像的潜在动作。然而,天真地合并点云会产生具有有限共享语义的细粒度动作表示,从而阻碍了跨实体预训练。为了解决这个问题,我们引入了统一末端执行器运动表示(UEMR),它保留了细粒度的运动信息,同时提高了潜在动作的跨实体泛化性。基于 UEMR,GALA 将捕获场景级动态的视觉潜在动作与捕获共享细粒度末端执行器关节的几何潜在动作相结合,为来自多实施数据(包括无动作的以自我为中心的人类视频)的 VLA 预训练提供有效的监督。细粒度运动探测、跨实施例检索和下游 VLA 评估的实验证明了 GALA 在跨实施例建模可推广的细粒度运动方面的有效性,实现了 68.3% RoboCasa-GR1 的成功率和 75.5% 的现实世界成功率。代码、附录和演示可从此 https URL 获取。