论文
GeomVLA:统一 3D 场景、运动和动作
GeomVLA: Unifying Scene, Motion, and Action in 3D
摘要
我们提出了 GeomVLA,这是一种视觉-语言-动作 (VLA) 模型,它将感知、潜在场景运动预测和动作生成统一在一个以机器人为中心的共享 3D 坐标系内。我们的方法使用深度和相机校准将预训练的 VLM 特征提升为基于空间的 3D 场景标记,同时保留 VLM 预训练期间学到的语义表示。我们进一步介绍了 3D 场景轨迹降噪器,这是一个任务条件模块,可以学习场景点在 3D 中如何移动的潜在表示。 GeomVLA 不是将预测轨迹作为开环计划执行,而是从轨迹降噪器中提取中间运动标记,并使用它们通过几何感知注意力来调节基于 3D 流的动作降噪器。 GeomVLA 在 CALVIN 上实现了最先进的性能,在 LIBERO 和 RoboTwin2.0 上实现了有竞争力的性能,并且在没有机器人动作预训练的情况下超越了现实世界操纵设置中的强大基线。广泛的消融表明,仅靠未来运动推理是不够的:主要收益与在整个感知到动作管道中保持场景表示、运动预测和机器人动作之间的几何一致性相关。