论文

GEAR-VLA:学习通用机器人操作的几何感知动作表示

GEAR-VLA: Learning Geometry-Aware Action Representations for Generalizable Robotic Manipulation

模型架构混合架构

摘要

视觉-语言-动作 (VLA) 模型实现了强大的基准性能,但在现实世界的部署中仍然难以应对看不见的物体、背景变化和不同的机器人实施例。我们认为,这是由于缺乏统一的几何感知操作表示,使得现有的 VLA 容易受到底层轨迹监督、未对齐的 3D 特征和实施例差异的影响。为了解决这个问题,我们提出了 GEAR-VLA,这是一个 VLA 框架,用于学习通用机器人操作的统一几何感知动作表示。 GEAR-VLA采用从粗到细的动作学习,在潜在动作标记将动作语义连接到梯度解耦的DiT连续动作专家之前,多源体现预训练为VLM配备了体现推理和离散动作理解。它通过将可训练的 3D 空间主干与 VLA 表示对齐,同时冻结原始的 VLM 对齐视觉路径,进一步执行语义对齐 3D 集成。为了在机器人之间共享这种表示,GEAR-VLA 使用实施例规范化,其中实施例感知状态和实施例不变动作将机器人差异限制在底层接口。广泛的模拟和真实世界实验证明了强大的泛化性:GEAR-VLA 在 LIBERO、零样本 LIBERO-Plus 和 RoboTwin 2.0 上实现了最先进的性能,在 AgileX 上达到了 85.9% 的成功率,在预训练未见过的 LDT-01 实施例上达到了 81.0% 的成功率,并在 6,360 次试验的通用抓取基准上获得了 90.1% 的成功率212 个看不见的物体。代码和模型将在 https://github.com/babynabeauty/GEAR-VLA 发布。