论文

对视觉语言动作模型的轨迹级重定向攻击

Trajectory-Level Redirection Attacks on Vision-Language-Action Models

模型评测安全与风险评测

摘要

视觉-语言-动作(VLA)策略将自然语言引入闭环机器人控制中,使机器人能够直接根据文本指令执行操作任务。相同的界面使文本在控制中扮演了反复出现的角色,因为提示在每个重新计划步骤中都会重复使用,并且每个提示条件操作都会改变策略所作用的未来观察结果。现有的 VLA 攻击研究对抗性提示,引发有针对性的底层操作或使此类操作在不断变化的图像中持续存在。我们确定了一种更强的轨迹级故障模式:仍然 $\textit{appears}$ 指定预期任务但重定向最终物理结果的提示。我们在数学上将这一设置形式化为 $\textit{命令保留轨迹重定向}$,这是一种仅提示的威胁模型,其中攻击者在事件发生之前选择一个提示,所有策略和环境组件保持固定,并且提示必须保持接近良性指令,同时省略目标词和校正语言。为了找到这样的提示,我们引入了一种 同策略 提示搜索方法,该方法使用采样轨迹来发现扰动,其闭环行为跟踪目标任务,同时满足命令保留约束。模拟和硬件实验表明,近乎良性的提示扰动可以将 VLA执行轨迹重定向到攻击者指定的目标。这些结果暴露了 VLA 指令与动作对齐中的轨迹级漏洞:看似保留预期命令的文本仍然可以让对手控制机器人的最终物理结果。项目网站:https://vla-redirection-attack.github.io/