论文

机器人操作是视觉到几何映射:语言和视频模型上的视觉几何骨干

Robotic Manipulation is Vision-to-Geometry Mapping: Vision-Geometry Backbones over Language and Video Models

摘要

从本质上讲,机器人操作是视觉到几何映射的问题($f(v) \rightarrow G$)。物理动作从根本上是由 3D 位置和空间关系等几何属性定义的。因此,我们认为通用机器人控制的基础应该是视觉几何骨干,而不是广泛采用的视觉语言或视频模型。传统的 VLA 和视频预测模型依赖于大规模 2D 图像文本或时间像素数据预训练的主干网。虽然有效,但它们的表示很大程度上是由语义概念或 2D 先验决定的,这些概念本质上并不符合物理操作所需的精确 3D 几何性质。在这一见解的推动下,我们提出了视觉-几何-动作 (VGA) 模型,该模型直接在预训练的 3D 表示上调节动作生成。具体来说,VGA 用预先训练的 3D 世界模型取代了传统的语言或视频主干,建立了无缝的视觉到几何映射,将视觉输入直接转换为物理动作。为了进一步增强几何一致性,我们引入渐进体积调制并联合训练动作和 3D 属性预测以保留几何表示。大量的实验验证了我们方法的有效性。在各个仿真基准测试中,VGA 的性能优于领先的 VLA、3D-VLA 和 WAM 基准,包括 $π_{0.5}$、OpenVLA-OFT、GeoVLA 和 Motus。在实际部署中,VGA 在看不见的视点下超越了 $π_{0.5}$,并准确遵循语言指令进行目标抓取。这些结果强调,基于原生 3D 表示进行操作,而不是主要依赖于语言或视频先验,为通向通用物理智能提供了一个有希望的方向。项目页面:https://hcplab-sysu.github.io/VisionGeometryActionModel。