论文
ExStereo:通过显式立体表示将 2D 视觉-语言-动作模型提升到 3D
ExStereo: Lifting 2D Vision-Language-Action Models to 3D with Explicit Stereo Representations
摘要
三维感知对于机器人操作至关重要,特别是对于高精度任务,因为从单目 RGB 观察中恢复度量深度和精确的 3D 对象位置本质上是不适定的。然而,许多视觉-语言-动作 (VLA) 模型仅依赖 RGB 观察来进行感知。利用立体匹配基础模型的最新进展,我们推出了 ExStereo,这是一种立体模块,可通过 3D 感知增强预先训练的 2D VLA。 ExStereo 从立体图像对重建场景几何形状,并将多视图观察渲染为用于立体特征提取的显式立体表示。动作专家的动作token通过我们提出的动作立体交叉注意机制选择性地关注生成的立体token,使策略能够生成以 3D 场景信息为条件的机器人动作。为了学习鲁棒的 3D 表示,我们在特定任务的后训练之前引入了中间训练阶段,使用大规模立体数据的自我监督学习目标。我们通过微调两个公开可用的VLA、$π_{0.5}$ 和 SmolVLA验证我们的方法,并在模拟和现实世界的双手 PiPER 平台上对其进行评估。在这两种设置中,VLA通过 ExStereo 进行微调,始终优于基线,证明了立体感知对于机器人操作的有效性。我们的项目网站位于:https://exstereo-vla.github.io/ExStereo/.
