论文

TAPDreamer:世界行动模型的可转移对抗补丁

TAPDreamer: Transferable Adversarial Patches for World Action Models

模型评测安全与风险评测

摘要

世界模型学习预测其环境将如何演变,使它们成为通用机器人控制的重要基础。然而,世界动作模型依赖于摄像机输入,其操作可能会破坏跨任务和动作策略使用的视觉表示。对这些模型的现有攻击针对受害者的行为或预测的未来进行优化,因此需要访问目标模型输出。在本文中,我们提出了一种针对世界动作模型的攻击 TAPDreamer,该攻击仅使用公共编码器来构建跨任务和动作架构传输的固定局部扰动。 TAPDreamer 不需要目标策略查询。我们的主要见解是,补丁引起的注意力权重和价值向量变化之间的相互作用会广播出几乎相同的表示变化,远远超出了补丁足迹,并且这种变化在任务观察中保持稳定。在这一见解的指导下,TAPDreamer 使用来自一个源任务的六个帧来最大化干净编码器表示和修补编码器表示之间的全局 L1 距离。在闭环评估中,每个基准测试一个冻结补丁,覆盖约 6.5% 的输入,将 FastWAM 在 40 个 LIBERO 任务中的成功率从 97.7% 降低到 0.0%,在 50 个 RoboTwin 任务中从 90.8% 降低到 0.0%;匹配的随机补丁保留了 81.5% 和 79.2% 的成功率。相同的补丁在两个 DreamWAM 配置上将成功率降低至 2.1% 和 0.8%,在 Motus 上将成功率降低至 10.0%。这些结果表明,仅保护下游动作生成是不够的:世界动作模型的防御还必须确保共享视觉编码器免受持续的局部扰动。

TAPDreamer:世界行动模型的可转移对抗补丁的原论文方法或结果图
图 1:TAPDreamer 使用公共视觉编码器和来自一个源任务的观察结果构建补丁,然后将其冻结以便在每个基准测试中跨任务和 WAM 进行部署。示例比较了使用 FastWAM 进行抽屉打开、使用 Motus 进行盆放置以及使用 DreamWAM 进行碗放置的干净执行和修补执行。