论文
视觉-语言-动作模型对于一步观察扰动是否具有鲁棒性?
Are Vision-Language-Action Models Robust to One-Step Observation Perturbations?
摘要
了解视觉-语言-动作 (VLA) 模型的安全风险对于其在物理世界中的部署至关重要。现有的安全性研究主要考虑持续性扰动,这些扰动在整个事件中连续应用于观察。然而,瞬时观测损坏(观测仅在一个事件中短暂受到严重干扰)仍然是一个尚未得到充分研究的安全威胁。为了解决这一差距,这项工作研究了在每集单个时间步上应用的单步扰动的鲁棒性。我们的实验表明,这些扰动会显着降低 VLA 性能,并且它们的影响取决于操作块的执行长度。基于它们,我们提出了 CARE,它根据与先前预测的动作块的一致性来动态选择执行长度。 CARE 以较低的计算开销提高了鲁棒性,同时通过仅在扰动下选择较短的执行长度来保持干净的性能。