论文

超越虚假稳定性:视觉语言模型中测试时对抗性防御的高噪声漂移门控

Beyond False Stability: High-Noise Drift Gating for Test-Time Adversarial Defenses in Vision-Language Models

AI 基础设施模型评测AI安全与内容治理基础设施安全与风险评测

摘要

CLIP 等视觉语言模型 (VLM) 显示出强大的零样本泛化能力,但仍然极易受到对抗性攻击。对抗性训练提高了鲁棒性,但计算成本高昂,会激发测试时的防御。最近的方法利用了 CLIP 的视觉表示如何响应随机扰动:聚合噪声视图中的预测、构建高斯噪声平均锚点并向其插值特征,或者应用反扰动。这些策略提高了鲁棒性,但通常会降低干净的准确性,从而产生不利的干净与鲁棒性权衡。我们重新审视随机测试时间防御,并在 CLIP 表示空间中识别出一个未充分探索的噪声区域转换。先前的工作主要探讨了弱噪声区域中的扰动,其中对抗性示例可能显得异常稳定(假稳定性)。我们的分析表明,随着扰动强度的增加,这种情况会发生逆转:超出弱噪声范围,对抗性表示变得比干净的表示明显更不稳定,从而给出更清晰的分离信号。这种转变在均匀和高斯噪声、光度和几何变换、数据集和不同的攻击中是一致的。它在对抗性训练的模型中很大程度上消失了,这表明它与非鲁棒 CLIP 中对抗性表示的脆弱局部盆地几何结构有关。我们提出了一种 无需训练 插件漂移门控机制,该机制使用高噪声特征漂移作为轻量级门控信号,仅在检测到类似对抗性的不稳定性时才触发现有的测试时防御。在 13 个数据集中,它持续改进了清洁与稳健的权衡。在八个细粒度数据集上,反击防御的平均清洁+对抗准确率从 65.7% 上升到 71.4%,噪声锚定的平均准确率从 68.4% 上升到 73.2%;在 ImageNet 上和四个转变的变体中,从 56.1% 到 66.2% 和 62.1% 到 67.6%。