论文

JailWAM:机器人控制中的越狱世界动作模型

JailWAM: Jailbreaking World Action Models in Robot Control

模型评测安全与风险评测

摘要

世界动作模型(WAM)已成为机器人操作的一个有前途的范例,可以实现跨不同任务和环境的物理交互。然而,它们直接遵循高级指令并执行物理动作的能力也带来了潜在的安全风险,因为对抗性设计的指令可能会引发不安全的机器人行为。为了系统地评估这些风险,我们提出了 JailWAM,这是第一个针对 WAM 的越狱评估框架。在 JailWAM 中,我们集成了三项关键创新:首先,为了解决评估异构底层动作输出的困难,我们引入了视觉轨迹映射,它将特定于模型的动作转换为统一的视觉轨迹表示,从而促进跨 WAM 架构的一致风险评估。其次,为了提供有效且细粒度的物理风险评估,我们开发了一个风险鉴别器,由根据物理后果排序的三个安全级别进行监督:安全合规性、运动故障和灾难性风险。这种严重性感知的公式使风险鉴别器能够区分不同的物理结果和视觉轨迹,并支持可扩展的风险筛查。第三,为了降低彻底执行对抗性候选者的成本,我们设计了一种双路径验证策略,将快速风险筛选与闭环物理模拟相结合,将计算成本高昂的验证限制在具有潜在安全风险的候选者身上。 RoboTwin模拟环境中的大量实验表明,JailWAM对LingBot-VA的攻击成功率达到84.2%,这表明WAM可能容易受到越狱攻击,从而引发不安全的物理行为。我们的研究结果可能会激发对未来实体机器人系统的安全评估和调整的进一步研究。