论文
像预训练一样进行微调:提高视觉语言模型中的零样本对抗鲁棒性
Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models
摘要
尽管 CLIP 等视觉语言模型具有令人印象深刻的零样本能力,但它已被证明容易受到对抗性攻击。为了增强其对抗鲁棒性,最近的研究通过将对抗图像与正确的类标签对齐,使用 ImageNet 等代理数据集上的对抗示例对 CLIP 的预训练视觉编码器进行了微调。然而,这些方法忽视了训练数据分布和学习目标的重要作用,导致零样本能力降低以及跨领域和数据集的鲁棒性可转移性有限。在这项工作中,我们提出了一个简单而有效的范例 AdvFLYP,它在对模型进行对抗性微调时遵循 CLIP 预训练过程的训练配方。具体来说,AdvFLYP 使用基于从网络收集的图像文本对创建的对抗性图像对 CLIP 进行微调,并通过对比损失将它们与相应的文本进行匹配。为了减轻噪声网络图像的对抗性图像嵌入的失真,我们进一步提出通过惩罚对抗性图像特征的偏差来正则化 AdvFLYP。我们证明 logits 和特征级正则化项分别有利于鲁棒性和干净的准确性。对跨越不同领域的 14 个下游数据集进行的广泛实验表明,我们的范式相对于主流实践具有优越性。我们的代码和模型权重发布于 https://github.com/Sxing2/AdvFLYP。