论文

MaskVLA:针对视觉-语言-动作模型轨迹过度拟合的视觉掩蔽

MaskVLA: Visual Masking Against Trajectory Overfitting of Vision-Language-Action Model

模型训练监督微调与指令调优

摘要

视觉-语言-动作 (VLA) 模型将视觉语言理解与可执行的机器人动作集成在一起,从而实现机器人控制的端到端学习。然而,我们的实证分析表明,现有模型在有限数据集上进行微调时表现出严重的轨迹过度拟合。为了指导模型有效利用手腕相机信息,我们提出了 MaskVLA,一种基于掩蔽的微调策略。通过随机屏蔽主摄像头的一小部分视觉信息,引导模型自主学习更细粒度、与任务相关、更有效的视觉特征。这个过程导致了稳健策略的出现,从而增强了模型处理复杂操作任务的能力并提高了其泛化性能。我们的方法在 RoboTwin 2.0 上进行了综合评估,与 $\pi_0$ 和 OpenVLA-OFT 相比,平均成功率分别提高了 23.2% 和 16.8%。此外,在现实世界的 ALOHA 机器人上进行的实验也证明了我们方法的有效性。