论文

双对抗 微调 用于增强大视觉语言模型的鲁棒性

Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model

模型训练监督微调与指令调优

摘要

虽然以 LLaVA 和 GPT-4V 为代表的大型视觉语言模型 (LVLM) 已展现出卓越的功能,但其视觉输入仍然容易受到对抗性攻击,构成重大安全风险。现有的防御方法主要针对单任务场景(例如零样本分类),因此缺乏跨各种多模式任务的通用性。为了解决这一限制,我们提出了一种双重对抗性 微调 框架,该框架联合优化来自两种模式的视觉和语义监督信号,增强模型的鲁棒性,同时泛化多个下游任务。所提出的框架包括两个核心组件,即$\textbf{Visual}$监督分支和$\textbf{Semantic}$监督分支。前一个分支利用通过冻结的原始视觉编码器提取的干净图像的特征来指导对抗鲁棒性,而后者将描述—图像对齐作为上下文信号,以在受到攻击时保持语义一致性。此外,我们的方法通过简单地替换原始模型中的 CLIP 视觉编码器来实现跨任务鲁棒性,无需单独的特定于任务的重新训练或架构修改。大量实验表明,我们的方法在零样本分类、图像描述和视觉问答(VQA)任务的对抗鲁棒性评估中优于最先进的方法。