论文
LIBERO-VIFO:视觉-语言-动作模型中视觉线索跟随的能力和安全性基准测试
LIBERO-VIFO: Benchmarking the Capability and Safety of Visual Cue Following in Vision-Language-Action Models
摘要
视觉线索越来越多地被用来指导机器人学习,但视觉-语言-动作(VLA)模型是否能够可靠地遵循授权线索而忽略未经授权的线索仍不清楚。现有的工作仅涵盖一小部分提示形式,并侧重于最终任务的成功,仅提供对提示跟踪能力的粗略评估。将所有视觉提示视为授权的同时也会留下未探索的未经授权的跟随的安全风险。为了解决这些差距,我们引入了 LIBERO-VIFO,这是一个评估 VLA 模型中视觉线索跟踪的能力和安全性的基准。 LIBERO-VIFO 定义了八个跨越不同形式的视觉提示系列。总共定义了两个部分的四个协议:第一部分测试提示理解和授权跟随,而第二部分评估语言提示冲突和空语言条件下未经授权的视觉提示跟随。对七个 VLA 模型的评估表明,虽然视觉提示理解不能可靠地转化为执行,但当前的 VLA 能够在没有语言指令的情况下执行提示指示的任务,从而暴露出未经授权的视觉提示跟随的新风险。对场景实例化提示、安全关键设置和真实机器人部署的扩展实验证实了这些发现。 LIBERO-VIFO 将视觉提示跟踪的能力和安全性纳入系统评估中,将以视觉为中心的安全性确立为 VLA 社区的新视角。