论文
LA4VLA:通过语言-动作预训练学习在看不到的情况下采取行动
LA4VLA: Learning to Act without Seeing via Language-Action Pretraining
摘要
视觉-语言-动作(VLA)模型通常通过将视觉观察和语言指令联合映射到动作来对机器人演示进行预训练。然而,密集的视觉动作监督可以主导相对稀疏的语言动作信号。因此,策略可能依赖于视觉快捷方式,而不是学习语言如何影响动作执行,从而使它们对视觉变化敏感。为了解决这一限制,我们提出了 LA4VLA,这是一种语言动作预训练框架,使策略能够在无需视觉观察的情况下获取语言条件动作先验。这些先验捕获了跨任务和场景共享的可重用操作技能,减少了对特定场景视觉线索的依赖。具体来说,LA4VLA 将专家演示轨迹分解为原子动作片段,并将每个片段与相应的底层动作描述配对。这产生了 LA-33K,这是一个 33K 语言动作 (LA) 片段的数据集,完全源自现有演示,无需额外的机器人数据收集。我们进一步开发了 LA4VLA-1B,一种轻量级 1B 参数 VLA 模型,并研究了将语言动作监督纳入 VLA 学习的三种范式:仅 LA 预训练、顺序 LA 到 VLA 预训练和混合 LA-VLA 预训练。在模拟和现实世界任务中,LA 预训练策略始终优于匹配的 VLA 预训练策略,而 LA 和 VLA 监督的结合可以带来进一步的收益。特别是,混合 LA-VLA 预训练使 LA4VLA-1B 在模拟和现实任务中的平均成功率比无预训练基线分别提高了 17.8 和 45.0 个百分点。这些结果表明 LA4VLA 是一种有效且互补的预训练策略,可用于构建更强大、更稳健的 VLA 策略。