论文
REALM:物理世界 VLM 的统一红队基准
REALM: A Unified Red-Teaming Benchmark for Physical-World VLMs
摘要
视觉语言模型(VLM)越来越多地用作安全关键物理系统中体现智能的感知推理支柱,其中感知或推理错误可能导致不安全的决策或行动。尽管已经开发了许多红队方法来探测 VLM 漏洞,但它们的评估仍然分散在数据集、指标和威胁模型中,这使得直接比较变得困难,并且模糊了观察到的差异是否源于更强的攻击、更脆弱的模型或不兼容的评估设置。现有的以聊天机器人为中心的红队基准主要标准化越狱和内容安全评估,但它们没有系统地捕获真实物理场景中的功能故障或涵盖针对物理世界 VLM 的红队方法。这就提出了在统一协议下比较不同攻击方法同时针对相同场景特定故障的关键挑战。我们引入了 REALM,据我们所知,这是物理世界 VLM 的第一个统一红队基准。 REALM 在具有共享数据集和指标的实用黑盒威胁模型下集成了 12 种红队方法、3 种与模型无关的防御和 13 个 VLM。为了协调跨攻击系列的对抗目标,REALM 引入了一个代理目标生成管道,该管道为每个场景构建共享、特定场景和有物理场景依据的攻击目标,从而能够在一致的对抗目标下公平比较不同的红队方法。我们的评估表明,文本和印刷注入攻击导致最多的失败,多模式协同优化产生最强的视觉扰动转移,单次攻击以低得多的成本接近迭代方法,并且模型规模本身并不能赋予对抗鲁棒性。代码可在 https://github.com/UCF-ML-Research/REALM 获取。