论文

DRIFT:利用对抗性补丁攻击破坏流量匹配 VLA 的去噪轨迹

DRIFT: Derailing Denoising Trajectories of Flow-Matching VLAs with Adversarial Patch Attack

模型评测安全与风险评测

摘要

诸如 pi0 之类的流匹配视觉语言动作 (VLA) 模型通过集成学习的去噪速度场来生成机器人动作,并且据报道可以抵抗容易欺骗自回归 VLA 的对抗性扰动。我们证明这种鲁棒性很大程度上是虚幻的:它源于先前的攻击忽略了多步去噪 ODE。我们引入了 DRIFT(通过流匹配轨迹的输入扰动进行去噪重定向),这是一个放置在机器人抓手上的测试时通用对抗补丁,用于攻击现成策略的去噪速度场。我们的中心发现是违反直觉的:仅攻击第一个去噪步骤比攻击更宽的步骤窗口更强大且更便宜,我们通过输入空间优化特有的梯度冲突来解释这一点,这与训练时后门机制完全相反。在四个 LIBERO 套件的 pi0 和 pi0.5 上,DRIFT 通过一个小补丁基本上破坏了所有最初可解决的任务,远远超过了动作和嵌入空间攻击基线。