论文
GuidedVLA:通过即插即用动作注意力专门化指定任务相关因素
GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization
摘要
视觉-语言-动作 (VLA) 模型旨在通过将动作作为强大的视觉-语言模型 (VLM) 中的一种模式来进行通用机器人学习。现有的 VLA 依赖于端到端的监督来隐式地使动作解码过程能够学习与任务相关的特征。然而,如果没有明确的指导,这些模型通常会过度拟合虚假相关性,例如视觉捷径或环境噪声,从而限制了它们的泛化能力。在本文中,我们介绍了 GuidedVLA,这是一个旨在手动引导动作生成以关注任务相关因素的框架。我们的核心见解是,不要将动作解码器视为单一的学习器,而是将其视为功能组件的集合。各个注意力头由手动定义的辅助信号进行监督,以捕获不同的因素。作为初步研究,我们用三个专门的头来实例化这个范式:对象基础、空间几何和时间技能逻辑。在模拟和真实机器人实验中,与强大的 VLA 基线相比,GuidedVLA 提高了域内和域外设置的成功率。最后,我们表明这些专门因素的质量与任务绩效呈正相关,并且我们的机制产生解耦的高质量特征。我们的结果表明,明确指导动作解码器学习是构建更稳健和更通用的 VLA 模型的一个有前途的方向。