论文
当聆听变得更容易时:清理视觉提示以获得无快捷方式的 VLA
When Listening Becomes Easier: Scrubbing Visual Cues for Shortcut-Free VLAs
摘要
捷径学习是机器人学习中的一个普遍问题。机器人演示数据集的多样性有限可能会误导政策,利用任务和不相关特征(例如视点或背景)之间的虚假相关性。收集足够多样化的机器人演示成本高昂且效率低下,从而激发了算法替代方案。我们专注于视觉-语言-动作(VLA)模型,发现不同的视觉-语言模型主干对视觉捷径学习表现出截然不同的敏感性水平。我们发现模型行为与我们提出的表示级指标、动作裕度相关,这不需要策略的推出。视觉快捷方式始终在早期层中输入动作表示,模型的不同之处在于后面层通过合并语言信息来纠正它们的程度。为了提高模型对语言的注意力,我们引入了任务清理,这是一种新的领域对抗训练方法,可以降低模型使用视觉快捷方式的可能性并提高 VLA 的泛化能力。实验于 跨多个 VLA 和视觉线索的模拟和现实世界都表明,任务清理提高了分布外的鲁棒性,并且通常消除了视觉捷径学习。