论文
灯光、摄像头、故障:当照明鲁棒性导致 VLA 模型对颜色视而不见时
Lights, Camera, Malfunction: When Illumination Robustness Leaves VLA Models Blind to Color
摘要
视觉-语言-动作(VLA)模型已成为通用机器人操作的强大范例;然而,它们向现实世界环境的过渡揭示了对轻微环境扰动的脆弱性。我们提出了 FLARE,这是一种优化的物理聚光灯攻击框架,它通过有针对性的照明来利用这些漏洞,将基线任务成功率降至零,而无需访问模型内部。虽然对抗性训练是标准对策,但我们发现了一个关键且之前被低估的防御陷阱:天真的数据增强错误地条件 VLA 模型将颜色作为噪声丢弃,将其视觉感知压缩为纯粹形状偏向的处理器。我们通过诊断灰度评估暴露了这种退化,其中受保护的模型在灰度输入上保持了较高的成功率,而其在良性、依赖颜色的现实世界任务上的成功率最多下降到 47.5%,远低于无保护的基线。为了解决这个问题,我们提出了 ChromaGuard,一种保留色度的对抗训练方法。在物理 6-DoF 机器人平台上,我们证明 ChromaGuard 在良性和受攻击的颜色相关任务中分别实现了 97.5% 和 92.5% 的成功率。