论文
IAU-FOA:增强闭源多模态模型对抗攻击的迁移性
Visual-Invariance-Augmented Feature Optimal Alignment for Transferable Adversarial Attacks against Closed-Source MLLMs
摘要
多模态大语言模型 (MLLM) 仍然容易受到可转移对抗样本的影响,特别是在只能访问开源 代理模型 模型的黑盒设置中。现有的定向传输攻击主要使用全局图像级特征(例如编码器[CLS]嵌入)来对齐对抗样本和目标样本。然而,这种粗略对齐不足以利用补丁级视觉结构,限制了异构闭源 MLLM 之间的可转移性。我们提出了 IAU-FOA,一种具有自适应不平衡传输的视觉不变性增强特征最优对齐攻击,以提高针对闭源 MLLM 的目标可转移性。 IAU-FOA 在全局和局部层面上对齐对抗样本和目标样本:基于余弦的目标缩小了它们的全局语义差距,而补丁 token 被聚集成紧凑的局部模式,并通过最佳传输进行匹配,以实现细粒度的特征对齐。即使对于没有可靠对应物的本地集群,平衡的最佳传输也会强制执行固定的边际质量,这可能会引入误导性的对齐方式梯度。因此,我们引入置信度自适应不平衡传输来放松弱匹配集群的这些限制,旨在减少不可靠的局部对齐并提高对抗性可转移性。我们进一步研究输入变换的效果,并提出视觉不变性增强,它应用双向像素强度重新缩放和每通道白平衡调整来模拟曝光、对比度、照明和色温变化。这种策略鼓励对抗性扰动在不同的视觉编码器上泛化。对开源和闭源 MLLM 的大量实验表明,IAU-FOA 始终优于最先进的可转移攻击方法。代码可在 https://github.com/jiaxiaojunQAQ/IAU-FOA. 获取
