论文

通过视觉语言模型的语义响应检测对抗图像

Detecting Adversarial Images through Response Profiles of Vision-Language Models

模型评测应用与实践安全与风险评测鲁棒性、公平性与可信度评测视觉感知与空间理解

摘要

对抗性扰动可以改变冻结视觉语言模型(VLM)的预测,同时使它们的置信度和图像文本相似性模式看起来似乎合理。我们研究是否可以根据图像与一般语义提示集合交互的更广泛方式来识别对抗性输入。我们的检测器使用类别级统计数据、提示之间的关系、与干净参考分布的偏差以及弱图像变换下的稳定性来总结这些响应,从而生成一个紧凑的响应配置文件,该响应配置文件在 VLM 保持固定的情况下由轻量级模型进行分类。我们在多个公共图像数据集、几个 CLIP 风格的视觉主干以及一系列基于梯度、基于优化、自动化和空间的攻击上评估了该方法。该检测器在特定攻击设置中实现了很强的辨别力,并且在对训练期间未见过的攻击进行评估时保留了显着的性能。在受控的检测器特定协议下,响应曲线表示优于评估的 嵌入几何基线。其他分析表明,功能组提供了补充信息,并且该方法在提示配置变化的情况下仍然有效。我们还检查了针对检测器感知的自适应攻击的推理成本和性能。总体而言,结果表明跨语义提示的响应模式为冻结 VLM 中的对抗性图像检测提供了有用的补充信号。

通过视觉语言模型的语义响应检测对抗图像:论文原图
图 2:使用以 ViT-B/16 作为主干的 CLIP 式 VLM 构建 CIFAR-10 测试图像的特征向量示例。该图显示了管道为一个样本计算的实际特征组:七个语义提示组的类别统计、包括图能量和局部偏差的提示图特征、两个主要语义类别的干净分布残差以及小图像变换下的稳定性特征。这些分量连接成最终的特征向量 phi⁡(x)\phi(x) 并传递到 MLP 检测器。对于此示例,计算值包括 H⁡(x)=1.9230H(x)=1.9230、γ⁡(x)=0.0116\gamma(x)=0.0116、EG(x)=1.2067E_{G}(x)=1.2067、 Rtop1=4.8525R_{\mathrm{top1}}=4.8525,Rtop2=6.8666R_{\mathrm{top2}}=6.8666,S⁡(x)=0.6781S(x)=0.6781,并且Δ𝒜(x)=0.1241\Delta_{\mathcal{A}}(x)=0.1241。