论文

VLA-Hijack:通过视觉本体感知劫持针对视觉-语言-动作模型的可转移补丁攻击

VLA-Hijack: A Transferable Patch Attack against Vision-Language-Action Models via Visual Proprioception Hijacking

模型评测安全与风险评测

摘要

虽然视觉-语言-行动(VLA)模型已成为强大的通用策略,但它们对对抗性补丁的严重脆弱性极大地阻碍了它们在安全关键领域的部署。此外,现有的补丁攻击主要集中在白盒设置上,严重过度拟合目标模型的特定动作输出空间,导致跨架构可迁移性较差。为了克服这一限制,我们提出了 VLA-Hijack,这是一个统一的对抗框架,它通过利用本工作中发现的一个基本漏洞来打破可转移性瓶颈:在计划任何运动之前,VLA 模型必须首先使用视觉信息在环境中定位自己的机械臂。针对这种共享的视觉自我定位过程,我们的方法同时优化了注意力引导本体感受抑制以抑制真实机械臂的特征,并优化多模式本体感受注射以将贴片建立为替代的“幻影体现”。通过交替语义概念锚定和视觉原型投影,VLA-Hijack有效切断了智能体真实体现与其控制策略之间的语义关系。跨不同架构(OpenVLA、UniVLA 和 CronusVLA)的大量实验表明,VLA-Hijack 在白盒设置中实现了卓越的优化效率,并为跨架构和跨域黑盒可转移性设置了新的 SOTA。