论文
UniTexture:视觉-语言-动作模型的跨任务通用对抗纹理
UniTexture: Cross-Task Universal Adversarial Textures for Vision-Language-Action Models
摘要
视觉-语言-动作(VLA)模型已经成为通用机器人策略,能够遵循不同的语言指令并执行广泛的操作任务。然而,他们对实体主体的直接控制也使他们面临可能导致不安全的身体行为的对抗性干扰。现有的针对机器人策略的攻击通常针对单个任务或指令进行优化,而多任务 VLA 的跨任务漏洞在很大程度上尚未被探索。我们引入了 UniTexture,这是一种跨任务通用对抗性纹理攻击,它使用单个纹理 3D 对象来引起跨多个任务的 VLA 动作预测的目标偏差。 UniTexture 通过可微分渲染器将策略动作输出的梯度反向传播到表面纹理参数。它使用目标动作空间目标来联合优化任务、指令、状态和视点分布上的共享纹理,将预测动作转向攻击者定义的目标,而无需为每个任务优化单独的纹理。我们在 OpenVLA 和 $π_{0.5}$ 上评估 UniTexture 的不同操作任务和多种评估设置。 UniTexture 将平均任务成功率从良性条件下的 90.0% 降低到攻击下的 48.4%,诱导目标对齐的动作转移,并进一步展示跨套件和跨模型转移,而无需重新优化。总之,这些发现揭示了多任务 VLA 中共享的跨任务漏洞,可以通过单个对抗性表面纹理系统地利用这些漏洞。