论文

ExStereo:通过显式立体表示将 2D 视觉-语言-动作模型提升到 3D

ExStereo: Lifting 2D Vision-Language-Action Models to 3D with Explicit Stereo Representations

摘要

三维感知对于机器人操作至关重要,特别是对于高精度任务,因为从单目 RGB 观察中恢复度量深度和精确的 3D 对象位置本质上是不适定的。然而,许多视觉-语言-动作 (VLA) 模型仅依赖 RGB 观察来进行感知。利用立体匹配基础模型的最新进展,我们推出了 ExStereo,这是一种立体模块,可通过 3D 感知增强预先训练的 2D VLA。 ExStereo 从立体图像对重建场景几何形状,并将多视图观察渲染为用于立体特征提取的显式立体表示。动作专家的动作token通过我们提出的动作立体交叉注意机制选择性地关注生成的立体token,使策略能够生成以 3D 场景信息为条件的机器人动作。为了学习鲁棒的 3D 表示,我们在特定任务的后训练之前引入了中间训练阶段,使用大规模立体数据的自我监督学习目标。我们通过微调两个公开可用的VLA、$π_{0.5}$ 和 SmolVLA验证我们的方法,并在模拟和现实世界的双手 PiPER 平台上对其进行评估。在这两种设置中,VLA通过 ExStereo 进行微调,始终优于基线,证明了立体感知对于机器人操作的有效性。我们的项目网站位于:https://exstereo-vla.github.io/ExStereo/.

ExStereo:通过显式立体表示将 2D 视觉-语言-动作模型提升到 3D的原论文方法或结果图
图 2:ExStereo 概述。 ExStereo 通过利用立体相机和预训练的冻结立体基础模型来增强预训练的VLA模型 [12]。给定立体图像对,立体模型会预测视差图,并使用相机内在函数和立体基线将视差图转换为度量深度图和 3D 点云。我们使用 z 缓冲从四个正交视点(顶部、前部、左部和右部)渲染点云。每个视图都以 $128\times 128$ 的分辨率进行光栅化,并包含深度、3D 坐标和有效性掩码。四个视图水平平铺为大小为 $128\times 512\times 5$ 的多视图观察,然后由视觉变换器 (ViT) [5] 处理以提取立体token $z$。我们通过我们提出的动作立体交叉注意利用 $z$ 进行动作生成,其中动作token $a^{\prime}$ 查询 $z$ 来选择性地检索相关的 3D 视觉特征,同时保持VLA的前缀序列和VLM权重不变。为了学习鲁棒的 3D 表示,我们引入了带有掩码自动编码 (MAE) 的中训练,其中VLA从大规模立体数据集中重建随机掩码多视图块,同时从不完整的观察中学习与动作相关的特征。在VLA后训练期间,ViT 和动作立体交叉注意块被冻结,以防止过度拟合特定于任务的演示,同时 MAE 解码器被丢弃。