论文

停电与冻结:分析摄像机故障下 VLA 的物理故障模式

Blackout vs. Freeze: Analyzing Physical Failure Modes of VLAs under Camera Faults

模型评测安全与风险评测

摘要

不可靠的视觉输入可能会损害任务表现,并给视觉-语言-动作(VLA)模型带来潜在的人身安全风险。我们分析了 $π0.5$ 和 GR00T 模型在图像黑屏和冻结等输入故障下的表现。我们发现,即使任务成功率同样低,停电和冻结也会产生不同的物理故障模式:冻结会导致更极端的关节行为,而抓手关闭后的停电会导致更多的物体掉落,最明显的是没有本体感觉。选择性干预研究表明,本体感觉(当前的机器人状态)部分补偿了删除的机器人描述并减少了非目标接触。然而,当手腕视图对象信息被删除时,即使有剩余场景视图的帮助,它也无法充分恢复任务的成功。然后,我们评估两种缓解方法:相机停电训练和错误视觉嵌入的无训练替换。两者都可以提高特定条件下任务的成功率,但会增加对周围物体的意外接触或干扰。真实的机器人试验进一步表明,在相机故障下成功执行仍然可能涉及意外的物理交互。这些发现促使设计 VLA 策略,使用在相机故障下仍然可用的机器人和物体信息来限制危险运动。