论文

SABRE:用于视觉-语言-动作模型的隐形代理黑盒攻击框架

SABER: A Stealthy Agentic Black-Box Attack Framework for Vision-Language-Action Models

模型评测安全与风险评测

摘要

视觉-语言-动作(VLA)模型使机器人能够遵循基于视觉观察的自然语言指令,但指令通道也引入了一个严重的漏洞:小的文本扰动可以改变下游机器人的行为。因此,系统稳健性评估需要黑盒攻击者能够跨不同的 VLA 模型生成最少但有效的指令编辑。为此,我们提出了 SABRE,一种以代理为中心的方法,用于在有限的编辑预算下自动生成对 VLA 模型的基于指令的对抗性攻击。 SABRE 使用经过 GRPO 训练的 ReAct 攻击者,在有限的编辑预算下使用字符、词元和提示级工具生成小型、可信的对抗性指令编辑,从而导致有针对性的行为退化,包括任务失败、不必要的长时间执行和增加约束违规。在跨越六种最先进的 VLA 模型的 LIBERO 基准上,SABRE 将任务成功率降低了 20.6%,将动作序列长度增加了 55%,并将约束违规率提高了 33%,同时与基于 GPT 的强大基准相比,所需的工具调用减少了 21.1%,字符编辑减少了 54.7%。这些结果表明,小的、合理的指令编辑足以显着降低机器人的执行能力,并且代理黑盒管道为红队机器人基础模型提供了实用的、可扩展的和自适应的方法。该代码库可在 https://github.com/wuxiyang1996/SABER 上公开获取。