论文

FocusVLA:视觉-语言-动作模型的集中视觉利用

FocusVLA: Focused Visual Utilization for Vision-Language-Action Models

模型架构Transformer

摘要

视觉-语言-行动 (VLA) 模型通过根据丰富的视觉-语言信息调节策略来改进行动的生成。然而,当前的自回归策略受到三个瓶颈的限制:(1) 架构偏差导致模型忽略视觉细节,(2) 过多的视觉标记使注意力难以集中在正确的区域,(3) 与任务无关的视觉信息引入了大量的噪音 - 一起严重损害了行动的质量。在本文中,我们研究如何有效地利用不同的视觉表示来生成动作。为此,我们首先凭经验验证上述问题,并表明 VLA 性能主要受视觉信息利用方式的限制,而不是受视觉表示质量的限制。基于这些见解,我们引入了 FocusVLA,这是一种新颖的范式,可将模型的注意力引导到与任务相关的视觉区域,从而有效地将视觉与行动联系起来。具体来说,我们首先提出 Modality Cascaded Attention 来消除捷径,从而迫使 VLA 模型依赖于任务相关的视觉细节来生成动作。此外,我们提出了焦点注意力(Focus Attention),它动态地选择与任务相关的视觉块来控制信息量,同时显式地调节它们的影响以抑制与任务无关的噪声。对模拟和现实世界机器人基准的大量实验表明,FocusVLA 不仅有效地利用视觉细节来执行灵巧的操作,而且还大大提高了性能并加速了各种任务的收敛。