论文

对抗性攻击已经给出了答案:方向偏差引导的视觉语言模型测试时防御

Adversarial Attacks Already Tell the Answer: Directional Bias-Guided Test-time Defense for Vision-Language Models

模型推理推理验证与自校正

摘要

视觉语言模型(VLM),例如 CLIP,已经表现出强大的零样本泛化能力,但仍然非常容易受到对抗性扰动的影响,在现实世界的应用中构成严重风险。 VLM 的测试时防御最近已成为一种有前景且有效的防御对抗性攻击的方法,而无需进行昂贵的大规模再训练。在这项工作中,我们发现了一个令人惊讶的现象:在不同的输入转换下,CLIP 特征空间中的对抗图像始终沿着主导方向移动,这与干净图像的分散模式形成鲜明对比。我们假设这种称为防御方向的主导转变与对抗性转变相反,将特征指向正确的类中心。基于这一见解,我们提出了方向偏差引导防御(DBD),这是一种测试时框架,可估计防御方向并采用基于 DB 分数的双流重建策略来恢复稳健的表示。在 15 个数据集上的实验表明,DBD 不仅在保持干净精度的同时实现了 SOTA 对抗鲁棒性,而且还揭示了反直觉的结果,即对抗精度甚至可以超越干净精度。这表明对抗性扰动本质上编码了关于真实决策边界的方向先验。