论文
通过具有多样性意识的红队团队揭示视觉-语言-行动模型中的语言脆弱性
Uncovering Linguistic Fragility in Vision-Language-Action Models via Diversity-Aware Red Teaming
摘要
视觉-语言-动作(VLA)模型在机器人操作方面取得了显着的成功。然而,它们对语言细微差别的鲁棒性仍然是一个关键的、尚未充分探索的安全问题,对现实世界的部署构成了重大的安全风险。红队,或识别引发灾难性行为的环境场景,是确保安全部署人工智能代理的重要一步。强化学习 (RL) 已成为自动化红队中一种很有前途的方法,旨在发现这些漏洞。然而,基于强化学习的标准对手往往会遭受严重的模式崩溃,因为其奖励最大化的性质,往往会收敛到一组狭窄的琐碎或重复的失败模式,无法揭示有意义的风险的全面情况。为了弥补这一差距,我们提出了一种新颖的 \textbf{D}iversity-\textbf{A}ware \textbf{E}mbodied \textbf{R}ed \textbf{T}eaming (\textbf{DAERT}) 框架,以暴露 VLA 针对语言变化的脆弱性。我们的设计基于评估统一的策略,该策略能够生成一组多样化的具有挑战性的指令,同时确保其攻击有效性(通过物理模拟器中的执行失败来衡量)。我们针对两个最先进的 VLA(包括 $π_0$ 和 OpenVLA)在不同的机器人基准测试中进行了广泛的实验。我们的方法不断发现更广泛、更有效的对抗性指令,将平均任务成功率从 93.33% 降低到 5.85%,展示了一种可扩展的方法来对 VLA 代理进行压力测试,并在实际部署之前暴露关键的安全盲点。