论文

超越补丁去除:视觉-语言-行动政策中持续的对抗性影响

Beyond Patch Removal: Persistent Adversarial Effects in Vision-Language-Action Policies

模型评测安全与风险评测

摘要

视觉-语言-操作 (VLA) 策略的对抗性补丁可能会导致立即操作损坏以及补丁被删除后仍然存在的持久状态影响。现有的评估主要集中在持续攻击上,并没有将这两种效果分开。我们引入了一种状态恢复协议,该协议删除匹配的操作块边界处的补丁,并在相同的剩余步骤预算下测量后续的可恢复性。干净、随机补丁、偏差匹配和固定方向控制将对抗效应与遮挡、动作误差幅度和方向持久性区分开来。我们还评估了在受控干预延迟下针对攻击引起的状态进行训练的恢复适配器。在采用 EDPA 攻击的 OpenVLA-OFT 上,只有 36.2% 的 LIBERO-Long 事件在五个块后仍可恢复,而偏差匹配和固定方向控制的这一比例为 89.9% 和 87.0%。在自回归 OpenVLA 上观察到类似的持续效应。恢复适配器将单块延迟时的恢复率从 7.7% 提高到 47.4%,但其效益会因延迟干预而大幅下降。这些结果表明,去除补丁后,对抗性影响可能持续存在,及时干预对于恢复至关重要。