论文

通过极其简单的模态掩蔽建立鲁棒的双手视觉-语言-动作模型

Robust Bimanual Vision-Language-Action Models via Embarrassingly Simple Modality Masking

模型训练监督微调与指令调优

摘要

基于查询的视觉-语言-动作(VLA)模型提供低延迟推理,这对双手机器人操作很有吸引力,但我们观察到它们在复杂的双臂任务中仍然会表现出不连续的动作和执行失败。我们假设不稳定的多视图和语言融合是导致这些失败的因素之一,通常与注意力分散到分散注意力的区域同时发生。为了提高鲁棒性,我们引入了模态掩蔽机制(M3),这是一种极其简单的仅训练策略,不需要架构更改或大规模机器人预训练。 M3 在训练期间随机掩盖模态通道的子集,将策略暴露于受控的部分观察,并鼓励其减少对分散注意力的线索的依赖,而更多地依赖仍然可靠的证据。我们在 RoboTwin 2.0 的 10 项双手任务和 3 项长期现实世界任务上对 M3 进行了评估。与 Adapter 基线相比,M3 在 Clean 设置中将平均成功率提高了 21.7%,在 Clean2Rand 中提高了 11.4%,其中策略在清洁演示上进行训练并在随机场景上进行评估,同时还将实际全任务的平均成功率提高了 30% 以上。这些结果表明,结构化训练时间屏蔽是提高基于查询的双手操作 VLA 策略稳健性的实用方法。