论文

CertVLA:针对视觉-语言-动作模型的物理视觉攻击的认证防御

CertVLA: Certified Defense against Physical Visual Attacks for Vision-Language-Action Models

智能体系统Agent 动作执行与治理

摘要

视觉-语言-动作 (VLA) 策略容易受到局部物理扰动的影响,但现有的经过认证的补丁防御针对的是离散标签,无法直接认证连续的、时间相关的动作。我们推出了 CertVLA,这是一种针对有界补丁和纹理攻击下的闭环 VLA 控制的经过认证的防御。 CertVLA 提出了一个行为一致动作的校准区域,而确定性覆盖掩模确保至少一个经过检查的预测不受攻击。具体来说,CertVLA 通过每个掩码对的良性变化来规范操作不一致,并且仅当单掩码锚在每个第二掩码下保持一致时才接受单掩码锚。然后,它校准所得的最大-最小-最大情节分数,以提供有限样本的干净覆盖。联合查询级决策将操作证书扩展到完整的闭环执行轨迹。此外,我们证明,针对任何满足有界支持威胁模型的自适应攻击者,CertVLA 认证的每条执行轨迹仅执行与攻击删除的干净预测一致的操作块。在双掩码执行轨迹正确性下,该一致性证书进一步保证了任务的成功。证书与补丁内容、生成方式、物理变换无关。模拟和现实世界中的实验证明了 CertVLA 针对补丁攻击的经验和经过认证的有效性,并对纹理攻击进行了额外的模拟验证。