论文
BadWorld:对世界模型的对抗性攻击
BadWorld: Adversarial Attacks on World Models
摘要
视觉世界模型 (VWM) 从单个上下文图像合成交互式、以动作为条件的卷展。然而,这些模型对对抗性扰动的鲁棒性如何仍然是一个悬而未决的问题。标准对抗性攻击无法评估此漏洞,因为攻击者缺乏 真值 未来视频,无法预测后续用户控制。我们引入了 BadWorld,这是一种专为自回归 VWM 量身定制的无标签对抗框架,可以系统地克服这两个限制。首先,为了绕过未来监督的需要,我们提出了一种自监督速度攻击,它直接破坏模型的早期去噪动态。其次,为了确保攻击泛化于不可预测的用户操作,我们制定了轨迹自适应双层优化,主动挖掘硬控制序列以形成与控制无关的扰动。通过对具有连续和离散控制的代表性 VWM 进行评估,BadWorld 暴露出严重的结构脆弱性。视觉上无法区分的对抗性图像在未来预测轨迹中可靠地引发灾难性的退化,导致去噪不完全、结构崩溃和控制不一致。这些发现揭示了在安全关键系统中部署 VWM 的关键风险,同时强调了隐私保护的实用机制。