论文

守卫漏判、机器人执行:VLA 指令中的隐含危害

What the Guard Misses, the Robot Executes: Implied Harm in VLA Instructions

模型评测安全与风险评测

摘要

视觉-语言-动作模型(VLA)按照指令行动而无法拒绝,因此筛选有害请求的责任就落在了监视器的肩上。我们测试这些监视器是否捕获出于有害原因请求的普通机器人任务,保持任务固定,同时仅改变意图的明确程度。 $π_{0.5}$ 在各个明确级别上完成任务,就像无害控件一样频繁。文本防护会标记几乎所有直率的请求,但很少有隐含的请求:高达 95% 的隐含伤害运行以任务完成而结束且没有标记,甚至在根据机器人指令重新校准后也高达 90%。监控模型的激活并不能弥补这一差距。线性 探针 在基本语言和视觉语言模型中几乎完美地将有害指令与无害指令分开,但这种分离在机器人训练在两个模型系列中减弱后,大多数是隐含的伤害。