论文
统一视觉语言模型中的对抗性鲁棒模型专家
Unifying Adversarially Robust Model Experts in Vision-Language Models
摘要
视觉语言模型(VLM),例如 CLIP,很容易受到对抗性攻击,给现实生活中的应用和部署带来严重问题。对抗性 微调 成为一种突出的防御方法;然而,不同的 微调 策略通常会产生具有不同鲁棒性特征的专用模型。每个经过微调的模型依次在某些评估环境中蓬勃发展,但在其他评估环境中却表现不佳,从而限制了它们的防御能力。我们将这些专门的微调模型称为鲁棒模型专家,并提出了一个协作对抗性 微调 框架:CARE - 使用嵌入对齐的协作对抗鲁棒性 微调。 CARE 在训练期间维护多个专家,通过嵌入空间协调实现知识交换,并将学到的知识整合到一个统一的鲁棒模型中。专家们相互受益,同时保留各自的专业知识,使最终模型能够继承互补的鲁棒性特性。在本文中,我们在两种不同的具有互补鲁棒性行为的对抗性 微调 策略上演示了 CARE。对经典图像分类和下游视觉语言任务的广泛实验显示了我们方法的有效性,CARE 能够超越单独学习的模型专家。结果表明,模型专家之间的协作学习是提高对抗鲁棒性的一个有前途的方向。