论文
攻击可信的想象力:对“想象然后行动”世界模型的神谕级完整性攻击
Attacking the Trusted Imagination: Oracle-Level Integrity Attacks on Imagine-then-Act World Models
摘要
最近的许多视觉-语言-行动(VLA)政策都采用想象然后行动的设计。世界行动模型(WAM)首先将短期未来想象为潜在轨迹 z~,然后以该轨迹为条件进行行动。我们将这种可信的想象,而不是反应性策略,确定为暴露的攻击面。下游预言机,例如安全门、视觉模型预测控制(MPC)规划器或想象然后检查验证器,使用 z~ 作为对未来的预测。因此,策略的稳健性并不意味着依赖 WAM 的系统的稳健性。根本现象是不对称。破坏想象力很容易,因为它只需要将 z~ 从其自然未来流形中移出即可。精确地操纵它很困难,因为它必须达到指定的歧管目标。我们采用基于能力的威胁模型,具有 L 无穷大有界观测扰动。攻击者通过完全可微的观察到想象图应用投影梯度下降。相同的非流形特性激发了无参数降噪检测器。我们评估了三个目标:RynnVLA-002、LingBot-VA 和 LaDi-WM。无目标损坏比随机损坏大约强 60 倍,并在 AUC 1.0 下检测到。目标控制仍然有限。适应性攻击者只能通过放弃破坏来逃避检测。反应性政策对于腐败的想象力来说仍然很强大。然而,本地想象力驱动的 MPC 表现出第一个特定于对手的任务失败(在 epsilon=0.01 时,成功率为 0.70 与 0.05;Fisher p < 10^-4)。