论文
让一切符合您的目标:通过多作物路由元优化针对闭源 MLLM 的普遍对抗性扰动
Make Anything Match Your Target: Universal Adversarial Perturbations against Closed-Source MLLMs via Multi-Crop Routed Meta Optimization
摘要
针对闭源多模态大语言模型(MLLM)的定向对抗攻击在黑盒迁移下被越来越多地探索,但先前方法主要以样本为特定目标,跨输入的复用性有限。我们转而研究更严格的设定——通用定向可迁移对抗攻击(UTTAA):单个扰动必须在未知商业MLLM上一致地把任意输入引向指定目标。把现有逐样本攻击朴素适配到这一通用设定面临三大困难:(i)由于目标裁剪的随机性,目标监督方差很高;(ii)逐token匹配不可靠,因为通用性会抑制本可锚定对齐的图像特定线索;(iii)少源每目标适配对初始化高度敏感,可能降低可达到的性能。本工作提出MCRMO-Attack,它经带注意力引导裁剪的多裁剪聚合稳定监督,通过对齐性门控的Token路由提升token级可靠性,并元学习跨目标扰动先验以产出更强的逐目标解。跨商业MLLM,我们将未见图像攻击成功率相对最强通用基线在GPT-4o上提升+23.7%,在Gemini-2.0上提升+19.9%。
