论文

XSPA:为 VLM 上的可转移攻击打造难以察觉的 X 形稀疏对抗性扰动

XSPA: Crafting Imperceptible X-Shaped Sparse Adversarial Perturbations for Transferable Attacks on VLMs

模型评测安全与风险评测

摘要

视觉语言模型 (VLM) 在零样本分类、图像描述和视觉问答 (VQA) 中共享视觉文本表示,从而创建了一条途径,通过该途径,细微的扰动可能会导致任务失败。我们引入了 X 形稀疏像素攻击(XSPA),这是一种将扰动限制在两条相交对角线的结构化攻击。在此固定支持内,XSPA 联合优化分类目标、跨任务语义指导、扰动幅度和线性平滑度。在默认设置下,它改变了大约 1.04\% 的图像像素。在 COCO 上,XSPA 在 OpenAI CLIP ViT-L/14 上将零射击精度降低了 52.33 点,在 OpenCLIP ViT-B/16 上降低了 67.00 点;基于 GPT-4 的图像描述一致性和 VQA 正确性分别下降了 58.60 和 44.25 点。匹配预算实验表明,自适应显着性Top-k支持比固定X形支持获得更高的攻击成功率,而XSPA提供更好的SSIM和LPIPS,但PSNR和MAE更差。相同图像分析没有发现三任务目标成功,这表明强代理分类效应不能可靠地转化为目标输出空间失败。这些结果将 XSPA 定位为一种受控压力测试,用于研究稀疏固定几何结构如何影响 VLM 的鲁棒性,而不是作为一种普遍优越的攻击。