论文
通过 VLA 模型的动作组合训练释放更多动作
Unleashing More Actions via Action Compositional Training for VLA Models
摘要
在演示数据的规模和多样性的驱动下,视觉-语言-动作模型在机器人操作方面表现出色。然而,标准训练范式通常会导致 VLA 模型严重过度适应特定的行为模式,导致它们无法泛化到分布外场景,即使这些场景仅需要相同子技能的新颖组合。虽然扩展数据集可以缓解这种过度拟合,但获取高质量的机器人数据仍然是劳动密集型且成本高昂的。为了在无需昂贵的人工远程操作的情况下解决这一僵局,并真正释放更多的行动,即,使 VLA 模型能够将已知的子技能组合成超出原始演示的更广泛的可执行行为集,我们提出了 ACT-VLA(VLA 模型的动作组合训练),这是一个离线数据增强框架,利用模型的潜在任务表示直接从现有的政策训练任务中合成新颖的、物理上有效的演示。通过消除额外的手动数据收集,我们的方法自动扩展训练分布并减轻过度拟合。我们评估了我们在模拟中处理具有挑战性的操作任务的方法。实验表明,虽然基线 VLA 模型由于原始分布过度拟合而泛化不佳,但使用我们的合成数据训练的策略取得了显着更高的成功率,验证了利用现有任务进行自动演示合成为扩大 VLA 泛化提供了一种有效、可扩展且数据高效的途径。