论文

StableVLA:无需额外数据即可实现稳健的视觉-语言-动作模型

StableVLA: Towards Robust Vision-Language-Action Models without Extra Data

模型架构新型架构

摘要

在训练数据集中包含所有可能的干扰是不可行的。这就提出了一个关键问题,即当遇到看不见的现实世界视觉干扰时,特别是在不完美的视觉条件下,视觉-语言-动作(VLA)模型的鲁棒性。在这项工作中,我们基于最近最先进的 VLA 模型进行了系统研究,发现当引入训练数据中不存在的视觉干扰时,性能会显着下降。为了缓解这个问题,我们提出了一种基于信息论的轻量级适配器模块,称为信息瓶颈适配器(IB-Adapter),它有选择地过滤来自视觉输入的潜在噪声。在不需要任何额外数据或增强策略的情况下,IB-Adapter 始终比基线平均提高 30%,同时添加的参数少于 10M,展现出显着的效率和有效性。此外,即使主干网缩小了 14 倍(0.5B 参数)并且 Open X-Embodiment 数据集上没有 预训练,我们的模型 StableVLA 仍能实现与 7B 规模最先进的 VLA 相媲美的鲁棒性。由于参数开销可以忽略不计(<10M),我们的方法保持了长视野任务的准确性,并在合成和物理视觉损坏下超越了 OpenPi。