论文

RedVLA:视觉-语言-动作模型的物理红队

RedVLA: Physical Red Teaming for Vision-Language-Action Models

模型评测安全与风险评测

摘要

视觉-语言-动作(VLA)模型在现实世界中的部署仍然受到不可预测和不可逆转的身体伤害风险的限制。然而,我们目前缺乏有效的机制来在部署前主动检测这些物理安全风险。为了解决这一差距,我们提出了 \textbf{RedVLA},这是 VLA 模型中第一个用于物理安全的红队框架。我们通过两个阶段的过程系统地发现不安全行为:(I)\textbf{风险场景综合}构建一个有效且任务可行的初始风险场景。具体来说,它从良性轨迹中识别关键交互区域,并将风险因素定位在这些区域内,旨在将其与 VLA 的执行流程纠缠在一起并引发目标不安全行为。 (II) \textbf{风险放大}确保跨异构模型的稳定启发。它通过轨迹特征引导的无梯度优化迭代地细化风险因素状态。对六个代表性 VLA 模型的实验表明,RedVLA 发现了多种不安全行为,并在 10 次优化迭代内实现了高达 95.5% 的 ASR。为了减轻这些风险,我们进一步提出了 SimpleVLA-Guard,这是一种根据 RedVLA 生成的数据构建的轻量级安全防护装置。我们的数据、资产和代码可在 \href{https://redvla.github.io}{here} 获取。