论文
LARA:视觉-语言-动作模型的潜在动作表示对齐
LARA: Latent Action Representation Alignment for Vision-Language-Action Models
摘要
视觉语言动作(VLA)模型使机器人能够直接根据观察和语言指令预测动作,但其性能取决于大规模、高质量的数据,并且受到现实世界机器人动作数据集稀缺性的限制。为了利用大量未标记的人类视频促进 VLA 模型学习,潜在动作模型 (LAM) 从视觉动态中学习潜在动作表示,为 VLA 学习提供额外的监督。然而,LAM 和 VLA 通常是分开训练的,导致 LAM 在 VLA 训练期间不接地,并且 VLA 模型受到冻结的 LAM 表示的约束。为了解决这些问题,我们提出了潜在动作表示对齐(LARA),这是一个即插即用的框架,通过表示对齐联合优化 LAM 和 VLA。这可以实现互惠互利,其中 LAM 通过动作轨迹进行学习以避免虚假的视觉变化,而 VLA 通过 LAM 中学习的前向动态进行规范化,以减少功能无效轨迹的幻觉。我们展示了 LARA 对 预训练、后训练 预训练 VLA 模型增强和 LAM 细化的多功能性和有效性,与 3 个模拟和 1 个精心设计的真实机器人操作基准相比,平均提高了约 10%、约 5% 和约 15%。