论文
从中间谱子空间的角度研究视觉语言模型的对抗性脆弱性
On Adversarial Vulnerability of Vision-Language Models through the Lens of Intermediate Spectral Subspaces
摘要
人们从决策边界几何、特征鲁棒性、输入输出雅可比行列式和逆问题的不稳定性等角度研究了深度神经网络(DNN)中的对抗性脆弱性。在这里,我们重点关注通过现代 DNN 传播信息的中间线性变换的谱结构,这是一种未经探索的对抗性脆弱性机制。具体来说,我们研究了基于 Transformer 的视觉语言模型,其线性层允许可解释的谱分解,并且其广泛采用使得理解其鲁棒性变得越来越重要。我们提出了一种白盒频谱子空间引导攻击(SSGRA),它将中间表示与右下奇异向量跨越的子空间对齐。我们的实验表明,与现有基线相比,攻击效率有所提高。此外,SSGRA 还提供了 VLM 中对抗性漏洞的光谱解释,为提高其稳健性提供了见解。