论文

让一切符合您的目标:通过多作物路由元优化针对闭源 MLLM 的普遍对抗性扰动

Make Anything Match Your Target: Universal Adversarial Perturbations against Closed-Source MLLMs via Multi-Crop Routed Meta Optimization

模型评测安全与风险评测

摘要

针对闭源多模态大语言模型(MLLM)的定向对抗攻击在黑盒迁移下被越来越多地探索,但先前方法主要以样本为特定目标,跨输入的复用性有限。我们转而研究更严格的设定——通用定向可迁移对抗攻击(UTTAA):单个扰动必须在未知商业MLLM上一致地把任意输入引向指定目标。把现有逐样本攻击朴素适配到这一通用设定面临三大困难:(i)由于目标裁剪的随机性,目标监督方差很高;(ii)逐token匹配不可靠,因为通用性会抑制本可锚定对齐的图像特定线索;(iii)少源每目标适配对初始化高度敏感,可能降低可达到的性能。本工作提出MCRMO-Attack,它经带注意力引导裁剪的多裁剪聚合稳定监督,通过对齐性门控的Token路由提升token级可靠性,并元学习跨目标扰动先验以产出更强的逐目标解。跨商业MLLM,我们将未见图像攻击成功率相对最强通用基线在GPT-4o上提升+23.7%,在Gemini-2.0上提升+19.9%。

经目标视图路由元优化对闭源MLLM的通用对抗攻击
图2:(左) 300 个 epoch 上带方差阴影的平均损失曲线对比,其中 MCA 与 MCA+AGC 变体相对基线表现出更好的收敛行为。(右) 梯度变化示意,表明所提出的方法有效降低了梯度随机性。