论文

GAM:以三维空间定位为基础的机器人动作模型

Grounded Action Model: 3D Grounding as a Foundation for Robotics

摘要

操纵策略必须知道哪些对象重要以及它们在哪里,然而当前机器人基础模型构建的预训练主干,从视觉语言动作模型(VLA)中的语言到世界动作模型(WAM)中的视频生成,并不直接需要这种带真实空间尺度的定位能力,而是从机器人演示中隐式学习。我们提出了空间定位动作模型 (GAM),这是一种使用 三维空间定位构建的机器人基础模型的新范式。 GAM 可以使用语言、点或框提示进行调节,这些提示首先会转换为所选对象的共享的以对象为中心的表示形式。这种表示捕获以目标为中心的视觉特征和度量对象几何形状,通过多流转换器与机器人状态历史混合以预测动作块。尽管 GAM 可以自主运行,但它们也可以充当低级控制器,由高级规划器使用其各种输入模式进行控制,从而实现长范围和依赖于内存的操作。在 RoboTwin 2.0 上,GAM 在 50 项任务中实现了 55.3% 的平均成功率(空间强迫为 52.0%),其中场景随机化下的成功率为 47.6%(Abot-M0 为 30.4%),其行动策略仅在干净场景演示上进行训练。在 LIBERO-PRO 上,它在 16 种扰动设置中实现了 61% 的最先进平均成功率($\pi_{0.5}$ 为 53%),当目标重新定位或新指定时收益最大。在两个真实的机器人上,GAM 在双手动 YAM 上的视觉转移下保留了 17/20 的成功率,而 $\pi_{0.5}$ 的成功率为 4/20,而在 Franka 上与 Molmo2 规划器的组合在长视野和依赖于记忆的任务上实现了 64.7% ID 和 49.8% OOD 步骤完成率。