论文
通过代理特定偏差校正提高视觉语言 预训练 模型的对抗性可迁移性
Improving Adversarial Transferability on Vision-Language Pre-training Models via Surrogate-Specific Bias Correction
摘要
对抗性示例揭示了 Vision-Language 预训练 (VLP) 模型中的漏洞,并为提高鲁棒性提供了见解。一个关键属性是跨模型可转移性,它可以实现基于转移的黑盒攻击。然而,现有的攻击往往严重依赖代理模型,导致跨模型性能下降。原因之一是对抗性优化可能更多地遵循代理模型响应而不是输入语义,使得更新方向对代理有效,但不太可转移到看不见的目标。我们将这种依赖性称为替代特定偏差。受这一观察的启发,DeBias-Attack 通过纠正对抗性优化方向上的替代特定偏差来提高可转移性。它维护两个扰动分支。主分支优化对原始图像的扰动并获得用于破坏图像文本对齐的对抗梯度。参考分支优化对弱语义图像的扰动,该弱语义图像由数据集平均图像构造,并在每次迭代时重新采样小高斯噪声。由于该弱语义图像几乎不包含清晰的视觉内容,因此其优化更多地反映了替代响应而不是图像语义,并且其参考梯度估计了替代特定偏差。 DeBias-Attack 在更新对抗图像之前删除主梯度在参考梯度上的对齐投影,然后使用更新的对抗图像执行上下文感知文本替换。 DeBias-Attack 是第一个基于转移的 VLP 攻击,它通过梯度校正来纠正代理特定偏差。实验表明,VLP 模型、下游任务以及开源和闭源多模态 大语言模型 都具有强大的性能。