论文
稀疏自动编码器作为即插即用防火墙,用于 VLM 中的对抗性攻击检测
Sparse Autoencoders as Plug-and-Play Firewalls for Adversarial Attack Detection in VLMs
摘要
视觉语言模型(VLM)发展迅速,并且越来越多地部署在现实世界的应用中,特别是随着基于代理的系统的兴起。然而,他们的安全受到的关注相对有限。即使是最新的专有和开放权重 VLM 仍然非常容易受到对抗性攻击,从而使下游应用程序面临重大风险。在这项工作中,我们提出了一种基于稀疏自动编码器(SAE)的新型轻量级对抗攻击检测框架,称为 SAEgis。通过将 SAE 模块插入到预训练的 VLM 中并使用标准重建目标对其进行训练,我们发现学习到的稀疏潜在特征自然地捕获与攻击相关的信号。这些功能可以对输入图像是否受到对抗性扰动进行可靠分类,即使对于以前未见过的样本也是如此。大量实验表明,SAEgis 在域内、跨域和跨攻击设置中实现了强大的性能,与现有基线相比,在跨域泛化方面有特别大的改进。此外,组合来自多层的信号进一步提高了鲁棒性和稳定性。据我们所知,这是第一个探索 SAE 作为 VLM 中对抗性攻击检测的即插即用机制的工作。我们的方法不需要额外的对抗性训练,引入的开销最小,并提供了一种提高现实世界 VLM 系统安全性的实用方法。