论文
论成功与简单:重新审视可转移视觉语言攻击管道
On Success and Simplicity: A Second Look at Transferable Vision-Language Attack Pipeline
摘要
众所周知,视觉语言 预训练 模型 (VLPM) 容易受到对抗性攻击。最近针对 VLPM 的可转移攻击遵循具有复杂损失函数或多阶段文本/图像攻击的通用流程。然而,在本文中,我们证明了这种复杂的攻击管道可以更简单但更成功。具体来说,我们确定了由于不适当的跨模式交互和过度操作而导致的三个以前被忽视的问题。为了解决这些问题,我们提出了简单视觉语言攻击(SimVLA)管道,它显着提高了可转移性和效率。对四个数据集和三个下游任务的实验验证了我们的管道的优越性。例如,在 Flickr30k 文本图像检索数据集上,我们的 SimVLA 在 R@1 可转移性方面优于 SOTA 基线 8.01\%-14.71\%,同时仅消耗约 35.73\% 的时间和 46.26\% 的最大 VRAM。总的来说,我们的 SimVLA 的优越性凸显了利用领域知识(例如,我们提出的跨模态单词识别)的重要性,而盲目追求复杂的操作(例如,复杂的损失函数和冗余的多阶段设计)甚至可能是有害的。我们希望我们的 SimVLA 能够作为未来扩展的简单而有效的支柱。代码可在 https://github.com/RYC-98/SimVLA 获取。