论文

STRONG-VLA:多模态扰动下视觉-语言-动作模型的解耦鲁棒性学习

STRONG-VLA: Decoupled Robustness Learning for Vision-Language-Action Models under Multimodal Perturbations

模型训练监督微调与指令调优

摘要

尽管在具体任务中表现强劲,但最近的视觉-语言-动作(VLA)模型在多模态扰动下仍然非常脆弱,其中视觉损坏和语言噪声共同导致分布变化,从而降低任务级执行。现有的鲁棒性方法通常依赖于扰动数据的联合训练,将鲁棒性视为静态目标,这导致鲁棒性和任务保真度之间的优化冲突。在这项工作中,我们提出了 STRONG-VLA,一个解耦的 微调 框架,它明确地将鲁棒性获取与任务对齐的细化分开。在第一阶段,模型接受难度不断增加的多模态扰动课程,从而在受控分布变化下实现渐进稳健性学习。在第二阶段,模型与干净的任务分布重新对齐,以恢复执行保真度,同时保持鲁棒性。我们进一步建立了一个全面的基准,包含 28 种扰动类型,涵盖文本和视觉模式,以传感器噪声、遮挡和指令损坏的现实来源为基础。 LIBERO 基准测试的大量实验表明,STRONG-VLA 能够持续提高多个 VLA 架构的任务成功率。在 OpenVLA 上,我们的方法在可见扰动下实现了高达 12.60% 的增益,在未见扰动下实现了 7.77% 的增益。值得注意的是,在 OpenVLA-OFT (+14.48% / +13.81%) 和 pi0 (+16.49% / +5.58%) 上观察到类似或更大的改进,表现出强大的跨架构泛化能力。 AIRBOT机器人平台上的真实实验进一步验证了其实际有效性。这些结果强调了解耦优化对于多模式鲁棒性的重要性,并将 STRONG-VLA 建立为一个简单但有原则的鲁棒体现控制框架。