论文

研究多模态 大语言模型 的对抗鲁棒性

Investigating Adversarial Robustness of Multi-modal Large Language Models

模型评测安全与风险评测

摘要

多模态 大语言模型 (MLLM) 在视觉语言任务上实现了强大的性能,但通过视觉编码器(例如 CLIP)合并视觉输入大大扩展了攻击面,使这些模型容易受到视觉对抗性扰动。先前的防御通常通过在对抗性 微调 期间强制与 CLIP 的原始嵌入空间严格对齐来保持与预先训练的 MLLM 的兼容性;虽然实用,但这种限制从根本上限制了可实现的鲁棒性。我们对 MLLM 中的对抗稳健性进行了系统研究。我们首先引入了一种诊断 CLIP 对齐协议,该协议在完整的 MLLM 训练之前预测哪些鲁棒视觉编码器将有效地转移到多模态设置,这表明大规模多模态对抗性预训练,而不是单独的单模态尺度,是强鲁棒性转移的关键因素。与受限的即插即用基线相比,通过端到端多模态训练将此类编码器集成到 MLLM 中,在强对抗性攻击下,字幕平均提高了 28 个 CIDEr 点,VQA 准确率提高了 11.7%。我们进一步表明,直接应用于标准非鲁棒 MLLM 的对抗性训练会降低干净性能和对抗性性能,建立鲁棒的视觉表示是严格的先决条件,而来自鲁棒骨干网的端到端对抗性训练可带来 1.9 CIDEr 点和 4.3% VQA 准确率的额外收益。除了训练时防御之外,轻量级测试时视觉随机变换可以作为非鲁棒 MLLM 的有效黑盒防御,将对抗性能从接近零提升到与鲁棒模型相当的水平。最后,我们表明,我们强大的模型大大减少了白盒视觉越狱攻击下有毒物质的产生。代码和预训练权重将公开发布。