论文

EgoSafetyBench:以自我为中心的诊断视频基准,用于评估作为运行时安全防护的具体 VLM

EgoSafetyBench: A Diagnostic Egocentric Video Benchmark for Evaluating Embodied VLMs as Runtime Safety Guards

模型评测基准与评测资源

摘要

视觉语言模型(VLM)现在被提议作为家庭和工厂中实体代理的运行时安全防护。可部署的警卫必须捕捉真正的不安全情况,同时避免对日常但表面上令人震惊的活动进行不必要的干预,这是二进制安全基准模糊的区别。我们推出了 EgoSafetyBench,这是一个以自我为中心的视频基准测试,包含以半秒粒度注释的 1,200 个机器人视图场景,用于评估 VLM 作为跨两条轨道的流式防护。情景轨迹(800 个场景)涵盖四个系列,从常规和安全但可疑的场景到明显的上下文危险。视觉通道轨道(400 个场景)以场景内文本(场景中可见的标志、贴纸或标签)为目标,这些文本可能会歪曲物理情况,将每个误导性标志与真实版本配对,以测试警卫是否将文本标记为误导性文本,以及文本是否会破坏其物理安全判断。两条轨道都使用对比梯子:几乎相同的场景仅在单个可见的决定提示上有所不同,因此正确的判断必须取决于该提示而不是整个场景类型。我们评估了十个开源和闭源 VLM。我们发现,虽然警卫能够可靠地识别出包含危险的视频,但他们经常会错过特定的危险时刻,尤其是上下文危险。此外,误导性的场景标志会降低所有测试的防护能力:易受攻击的模型会错过多达三分之一的危险,而强大的模型会过度干预安全内容。匹配的控制表明,表面上的安全鲁棒性往往反映了不加区别的警报,而不是真正的物理推理。