论文
GWM-VLA:用于视觉-语言-动作学习的几何感知潜在世界建模
GWM-VLA: Geometry-Aware Latent World Modeling for Vision-Language-Action Learning
摘要
视觉-语言-动作(VLA)模型实现了强大的机器人操作性能,但在视觉和环境变化下通常会降低性能。潜在世界建模提供了一种有前途的方法来提高鲁棒性,但现有方法通常独立编码摄像机视图并预测整体场景动态,而无需显式建模其几何关系。我们提出了 GWM-VLA,一种用于 VLA 学习的几何感知潜在世界建模框架。 GWM-VLA 结合了几何感知多视图状态编码、全局上下文条件目标视图预测以及基于机器人动作监督的共享潜在动作表示。具体来说,VGGT-$Ω$ 在每个时间步联合聚合多视图观察,以构建几何感知的多视图状态。潜在世界模型使用多视图聚合后获得的补丁和寄存器词元来预测所选目标视图的下一步补丁词元,从而保留多视图几何信息而不预测完整的多视图状态。我们在实验中使用手腕视图作为目标,更加强调末端执行器运动和局部夹具与物体的交互。最后,共享的潜在动作表示条件潜在世界模型和流匹配动作头,允许潜在预测监督和 真值 机器人动作监督共同形成相同的潜在动作表示。模拟和现实环境中的实验证明了 GWM-VLA 的有效性和鲁棒性。