论文

HQA-VLAtack:对视觉语言预训练模型进行高质量对抗性攻击

HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models

模型评测安全与风险评测

摘要

对视觉语言预训练模型的黑盒对抗攻击是一项实用且具有挑战性的任务,因为需要同时考虑文本和图像扰动,并且只能访问预测结果。对这个问题的研究还处于起步阶段,可用的方法也很少。然而,现有的方法要么依赖于复杂的迭代交叉搜索策略,这不可避免地消耗大量查询,要么只考虑减少正图像文本对的相似度而忽略负图像文本对的相似度,这也会被隐式减少,从而不可避免地影响攻击性能。为了缓解上述问题,我们提出了一个简单而有效的框架,用于在视觉语言预训练模型上生成高质量的对抗示例,称为 HQA-VLAtack,它由文本和图像攻击阶段组成。对于文本扰动生成,它利用反拟合词向量生成替代词集,从而保证替代词与原始词之间的语义一致性。对于图像扰动生成,它首先通过层重要性引导策略初始化图像对抗样本,然后利用对比学习来优化图像对抗扰动,从而确保正图像文本对的相似度降低,负图像文本对的相似度增加。这样,优化后的对抗图像和文本更有可能检索到反例,从而提高攻击成功率。三个基准数据集的实验结果表明,HQA-VLAtack 在攻击成功率方面显着优于强基线。