论文
ViDAL:以视觉动力学对齐 VLA 的动作潜空间
ViDAL: A Visual Dynamics-Grounded Action Latent Space for Vision-Language-Action Models
摘要
视觉-语言-动作 (VLA) 模型已成为机器人策略学习的中心范例,它以三种形式预测动作:原始 动作块、离散动作 token 或连续动作 潜变量。然而,现有的动作表示主要对动作轨迹进行建模,对这些动作引起的视觉动态的考虑有限。我们引入了 ViDAL,这是一种基于视觉动力学的动作 潜空间,它将连续动作 潜变量 锚定在场景的未来视觉动态中。具体来说,ViDAL 通过训练学习动作 潜空间(动作变分自动编码器(动作 VAE))来重建 动作块,同时将其潜在与未来场景动态对齐。当集成到下游机器人策略中时,所提出的 Action VAE 充当与多个 VLA 架构兼容的插件动作接口,并支持可选的未来视频预测作为附加功能。根据经验,ViDAL 在 LIBERO 上的平均成功率为 98.1%,优于 LIBERO 上的竞争基线,将 RoboTwin 2.0 上的多任务 $π_{0.5}$ 策略在 50 个双臂任务中的成功率从 54.3% 提高到 65.5%(干净),从 33.2% 提高到 43.1%(随机),并产生 20.0% 和 20.0% 的成功率。在现实世界的单臂 Franka 和双臂 ARX 机器人平台上,绝对成功率提高了 23.4%。
