论文

PHANTOM:面向视觉语言模型的大规模多模态对抗攻击数据集

PHANTOM: A Large-Scale Dataset of Multimodal Adversarial Attacks for Vision-Language Models

模型评测基准与评测资源

摘要

我们介绍面向视觉语言模型(VLM)的大规模开源预生成对抗攻击数据集。该数据集设计为多样、有代表性且实用——通过覆盖10个高级类别与55个有害意图子类扩展现有基准。鉴于生成大量攻击的计算成本与复杂度——我们的首要目标是让对抗数据对研究社区可及。数据集含47,524个对抗样本——以近期文献的SOTA攻击策略生成。我们的工作通过整合并扩展来自多个既有来源的先前的基准——形成7,826个意图——并引入额外类别以拓宽覆盖。这为研究模型鲁棒性与对齐提供现实评估资源。该数据集旨在使研究者与从业者能系统评估VLM鲁棒性与安全性、微调攻击生成模型——并在多样对抗条件下开发或压力测试防御护栏。通过发布该资源——我们旨在降低对抗研究门槛——促成更可复现、全面、可比的VLM安全评估。

PHANTOM:面向视觉语言模型的大规模多模态对抗攻击数据集:论文配图
图 1:PHANTOM 概述。风险分类法(1010 个类别、5555 个子类别、7 8267\,826 个意图)定义了数据集;多模态攻击(BAP、IDEATOR、MML、FC ATTACK、CSDJ)将每个意图转化为多模态对抗样本(有害文本提示++图像),给出 47 52447\,524(提示、图像)对。每对都被赋予 9 个开源 VLM 的白盒,并转移到 6 个闭源黑盒模型;法官对每个回答进行评分以获得每个类别的 ASR。左下:来自不同攻击系列的代表性样本。