论文
您的模型已经知道:视觉-语言-动作模型的注意力引导安全过滤器
Your Model Already Knows: Attention-Guided Safety Filter for Vision-Language-Action Models
摘要
视觉-语言-动作(VLA)模型在各种机器人操作任务中展示了令人印象深刻的端到端性能。然而,这些策略不能保证不会与场景中与任务无关的对象发生碰撞。现有的安全过滤器通过查询视觉语言模型(VLM)来识别障碍物及其位置来回避这个问题。然而,这对于在控制循环中运行来说太慢,并且只能在情节初始化时调用,使得过滤器无法跟踪移动的障碍物。我们发现 VLA 模型中的少量注意力头能够可靠地定位策略想要接近的对象。这些头可以在 无需训练 安全框架内利用,该框架在每一步中从注意力头获取活动目标,将场景的其余部分视为障碍物,并将其输入控制屏障功能 (CBF) 过滤器。与轻量级实时对象跟踪器一起,可以避免非静态障碍物的碰撞。我们在 SafeLIBERO 上评估我们的框架,并通过移动障碍对其进行扩展。在原始静态基准测试中,我们的方法的性能与使用特权模拟器状态来识别目标的预言机相当,模拟在情节初始化时运行一次的基于 VLM 的识别步骤。在动态变体中,预言机的初始目标分配变得过时,我们的方法平均比它高出 43%。我们的研究结果表明,实时安全过滤所需的感知信号已经存在于 VLA 策略中,并且无需额外的训练或大量辅助模型即可利用。