论文
WSA$_1$:用于通用机器人控制的以 3D 为中心的世界空间动作模型
WSA$_1$: a 3D-Centric World-Spatial-Action Model for Generalizable Robot Control
摘要
嵌入式人工智能的最新进展已将机器人基础模型(RFM)确立为迄今为止通用机器人系统的主要方法。通过在广泛的机器人演示中利用模仿学习,RFM 在将视觉观察和语言指令映射到连续的机器人动作方面取得了令人印象深刻的能力。然而,当前的 RFM 缺乏推理物理动力学以及机器人行为对 3D 物理世界的因果影响的固有能力。这造成了以 2D 为中心的视觉感知和以 3D 为中心的体现交互之间的根本不匹配,严重限制了 RFM 在现实世界任务中的泛化能力。为了解决这一差距,我们提出了 WSA$_1$,这是一种基于所提出的以 3D 为中心的世界空间动作建模范式构建的新型 RFM。它不仅学习未来机器人行为的 3D 世界感知视觉思维,还对 3D 世界状态转换和机器人动作之间的相互约束进行建模,以增强行为泛化。值得注意的是,WSA$_1$ 通过 6000 小时的专家演示数据(仅 1000 小时的真实机器人数据)实现了高度数据效率的 预训练,同时在 RoboTwin2.0 模拟基准上提供了有竞争力的操纵性能(93% 的成功率),并在现实世界的机器人控制任务上实现了比最先进的 RFM 平均提升 20% 的性能。这些结果表明,当与以 3D 为中心的世界动作联合建模相结合时,无需大规模真实机器人数据即可实现可推广的 RFM,这为通用机器人系统提供了一条实用且经济实惠的途径。