论文
对抗性训练是否可以提高多视图 VLA 的泛化能力?揭示并缓解视图崩溃
Does Adversarial Training Improve Generalization in Multi-View VLAs? Revealing and Mitigating View Collapse
摘要
视觉语言动作(VLA)模型采用预训练的视觉语言模型(VLM)进行闭环机器人控制,将其感知和语义能力转移到动作预测。然而,尽管分布内性能很强,VLA 经常会在部署变化时性能下降。对抗性训练(AT)提供了一种模型自适应的鲁棒性方法,无需明确预测个体变化,但其对多视图 VLA 中自然分布变化泛化的影响仍不清楚。我们使用直接改编自预训练 VLM 的多视图 VLA 研究这个问题,并评估七个 LIBERO-Plus 移位轴的泛化能力。 Direct AT 极大地改善了相机视角和传感器噪声,这两个转变仅影响第三人称视角,但对其他转变产生混合或负面影响。受控视图干预揭示了一种令人惊讶的失败模式,我们称之为视图崩溃:直接 AT 可以如此强烈地改变跨视图依赖,以至于策略变得由手腕视图主导。这暴露了一个 鲁棒性快捷方式:对移动视图的明显鲁棒性可能是由于减少了该视图的使用而不是对它的更鲁棒的感知而产生的。这激发了鲁棒感知(在视图内变化下提取可靠信息)和鲁棒融合(根据视图的可靠性调整视图之间的依赖)之间的区别。为了减少固定视图依赖,我们使用简单的视图交换干预,然后重新评估 AT。通过视图交换,AT 进一步改善了相机视角、传感器噪声和机器人初始状态,而其对其他班次的影响仍然参差不齐。我们的结果表明,多视图鲁棒性需要将感知的改善与跨视图依赖的变化分开,并且 AT 提供选择性而非通用的分布转移优势。