论文
Lift3D-VLA:将 VLA 模型提升为 3D 几何和动力学感知操作
Lift3D-VLA: Lifting VLA Models to 3D Geometry and Dynamics-Aware Manipulation
摘要
最近,视觉-语言-动作(VLA)模型在不同的任务中表现出了很强的泛化能力。然而,在物理环境中有效的机器人操作从根本上需要几何理解和空间推理。虽然一些 VLA 方法尝试合并 3D 信息,但它们受到当前 3D 编码管道中有限的数据可用性和几何信息丢失的限制,并且无法在动态环境中联合捕获 3D 几何和时间结构化动作。为了解决这些限制,我们引入了 Lift3D-VLA,这是一个统一的 VLA 框架,为模型配备显式 3D 点云推理,并支持时间连贯的动作生成。首先,在我们之前的工作 Lift3D 的基础上,提出了一种增强的 2D 模型提升策略,用于将 3D 点与预训练的 2D 位置嵌入进行几何对齐。该设计可在 VLA 视觉编码器内进行直接点云编码,同时最大限度地减少空间信息损失。基于显式 3D 输入,我们提出了以几何为中心的掩模自动编码(GC-MAE),这是一种双目标自监督框架,可以重建当前点云,同时预测其未来的几何演化。该公式允许 2D 视觉编码器内化 3D 结构和物理动力学。为了充分利用 3D 表示,我们进一步设计了分层时间动作建模,它利用 LLM 的多个层来协作预测动作块,从而实现时间一致的预测。在 22 个模拟任务和 8 个现实世界操作任务中,Lift3D-VLA 在 MetaWorld 和 RLBench 上的平均成功率比之前表现最好的 VLA 方法高出 10.8% 和 11.1%,并且比最强的现实世界基线高 4 个百分点,同时对分布外扰动表现出更强的泛化能力。