论文
多视图统一相机字段:仅 RGB 多相机 VLA 策略的几何形状面向动作表示
Multi-View Unified Camera Fields: Geometry-Shaped Action-Facing Representations for RGB-Only Multi-Camera VLA Policies
摘要
视觉-语言-动作(VLA)模型在机器人操作方面表现出很强的通用性,但复杂的接触丰富的任务通常受益于联合捕获末端执行器、物体和遮挡下目标的多摄像头观察。现有的多摄像头 VLA 通常会连接视图标记,导致动作表示在度量深度方面较弱,并且在摄像头之间不一致。我们引入了多视图统一相机场(MVUCF),这是一种仅用于训练的框架,可形成跨视图的共享的面向动作的潜在场。坐标查询深度目标使度量深度可恢复,而预处理感知对应目标则对齐从不同相机观察相同物理点的标记。两者都直接塑造动作模块消耗的隐藏状态。几何注入后,深度、相机校准和辅助头被删除,因此部署使用原始的仅 RGB 图形,没有额外的推理 FLOP。伸出的探针证实了更强的深度恢复和交叉视图匹配。在匹配的 GR00T-N1.6 设置下,MVUCF 在 LIBERO 上达到 98.9%,将 LIBERO-Plus 提高了 22.4 分,并将跨越三个动作系列的六项 RoboTwin 任务的成功率提高了 23.3 分:触摸、移动和放置以及接触交互。真实世界的人形实验进一步证明了其在仅 RGB 部署下的实际有效性。