论文
TrapVLA:在配置的故障模式中捕获视觉-语言-动作模型
TrapVLA: Trapping Vision-Language-Action Models in Configured Failure Modes
摘要
这项工作引入了配置故障陷阱,这是一种针对视觉-语言-动作(VLA)模型的新型后门攻击任务,旨在通过隐形文本触发器激活攻击并诱发配置故障模式。与之前将任何任务失败视为成功攻击的后门攻击不同,配置失败陷阱要求攻击者控制机器人如何失败(例如,使机器人以指定的位置偏移进行抓取),这使其更具挑战性且难以检测。为了支持新任务,我们提出了一个用于合成高质量目标轨迹的有效数据引擎和一个用于测量配置故障保真度的自动化套件。然后,在此基础上,我们构建了两个新的基准测试,即 Trap-LIBERO 和 Trap-RoboTwin,它们跨四种代表性故障模式实例化了配置故障捕获。为了解决此任务,我们将稀疏动作偏差视为一项关键挑战,并相应地提出了一种名为 TrapVLA 的新方法,该方法显式学习触发引起的动作残差,以将策略引导至配置的故障行为。跨模拟基准和现实世界机器人设置的大量实验表明,TrapVLA 有效地将配置的故障模式注入 VLA 模型,同时在很大程度上保留了干净数据的性能。项目页面:https://john-liua.github.io/TrapVLA/