论文
BadWAM:当世界行动模型梦想正确但行动错误时
BadWAM: When World-Action Models Dream Right but Act Wrong
摘要
世界行动模型(WAM)正在成为体现控制的有希望的基础:它们不是单独预测行动,而是学习将行动生成与未来世界预测相结合的表示。这种耦合通常被视为鲁棒性、可解释性和安全性的来源,因为机器人的动作原则上可以根据其想象的未来进行检查。在本文中,我们表明这种假设是脆弱的。我们引入了 BadWAM,这是一个用于建模和评估世界动作漂移攻击的统一框架:一种新型的特定于 WAM 的对抗性攻击,它使用小的视觉扰动来打破 WAM 想象和执行之间的一致性。 BadWAM 按照两个自然标准来描述此攻击面:攻击强度和隐蔽性。当对手优先考虑破坏时,BadWAM 会实例化仅采取行动的对抗性攻击,这会直接推动模型采取任务失败的行动。当对手额外优先考虑隐身时,BadWAM 会实例化一种保留想象力的对抗性攻击,旨在引发有害的行动转变,同时使模型的预测未来接近其干净的想象力。这两种攻击共同捕获了一系列特定于 WAM 的故障:从公开的操作劫持到模型似乎想象了一个合理的未来但执行不同步操作的隐秘情况。我们评估了不同 WAM 变体的 BadWAM。结果表明,我们的攻击大大降低了闭环执行下任务的成功率。例如,我们的仅操作攻击将模型性能从 96.5% 成功率降低到 43.1%。我们的想象力保留攻击的结果进一步暴露了 WAM 特有的漏洞:适度的未来保留正则化可以保持强大的攻击性能,同时减少未来的想象力漂移。