论文
PHANTOM:面向视觉语言模型的大规模多模态对抗攻击数据集
PHANTOM: A Large-Scale Dataset of Multimodal Adversarial Attacks for Vision-Language Models
摘要
我们介绍面向视觉语言模型(VLM)的大规模开源预生成对抗攻击数据集。该数据集设计为多样、有代表性且实用——通过覆盖10个高级类别与55个有害意图子类扩展现有基准。鉴于生成大量攻击的计算成本与复杂度——我们的首要目标是让对抗数据对研究社区可及。数据集含47,524个对抗样本——以近期文献的SOTA攻击策略生成。我们的工作通过整合并扩展来自多个既有来源的先前的基准——形成7,826个意图——并引入额外类别以拓宽覆盖。这为研究模型鲁棒性与对齐提供现实评估资源。该数据集旨在使研究者与从业者能系统评估VLM鲁棒性与安全性、微调攻击生成模型——并在多样对抗条件下开发或压力测试防御护栏。通过发布该资源——我们旨在降低对抗研究门槛——促成更可复现、全面、可比的VLM安全评估。
