论文

PDA:针对对抗性图像攻击的鲁棒视觉语言模型的文本增强防御框架

PDA: Text-Augmented Defense Framework for Robust Vision-Language Models against Adversarial Image Attacks

AI 基础设施AI安全与内容治理基础设施

摘要

视觉语言模型(VLM)容易受到对抗性图像扰动的影响。现有的基于针对特定任务的对抗性示例的对抗性训练的工作在计算上是昂贵的,并且通常无法推广到看不见的攻击类型。为了解决这些限制,我们引入了释义-分解-聚合(PDA),这是一种 无需训练 防御框架,它利用文本增强来增强 VLM 在各种对抗性图像攻击下的鲁棒性。 PDA 完全在测试时执行提示释义、问题分解和一致性聚合,因此不需要对底层模型进行修改。为了平衡鲁棒性和效率,我们将 PDA 实例化为不变量,以降低推理成本,同时保留大部分鲁棒性收益。对多个 VLM 架构和视觉问答、分类和字幕基准测试的实验表明,PDA 针对各种对抗性扰动实现了一致的鲁棒性增益,同时保持有竞争力的干净准确性,为 VLM 在推理过程中建立了通用、强大且实用的防御框架。