论文

AGFT:对齐引导的 微调 用于视觉语言模型的零样本对抗鲁棒性

AGFT: Alignment-Guided Fine-Tuning for Zero-Shot Adversarial Robustness of Vision-Language Models

模型训练监督微调与指令调优

摘要

预训练的视觉语言模型(VLM)表现出强大的零样本泛化能力,但仍然容易受到对抗性扰动的影响。现有的分类引导的对抗性 微调 方法经常破坏预先训练的跨模式对齐,削弱视觉文本对应性并降低零样本性能。在本文中,我们提出了一种对齐引导的 微调 (AGFT) 框架,该框架增强了零样本对抗的鲁棒性,同时保留了跨模态语义结构。与依赖硬标签且无法维持图像和文本之间相对关系的基于标签的方法不同,AGFT 利用原始模型的概率预测进行文本引导的对抗训练,通过软对齐分布将对抗视觉特征与文本嵌入对齐,从而提高零样本对抗的鲁棒性。为了解决 微调 引入的结构差异,我们引入了一种分布一致性校准机制,该机制可调整鲁棒模型输出以匹配预训练模型预测的温度缩放版本。跨多个零样本基准的大量实验表明,AGFT 的性能优于最先进的方法,同时显着提高了零样本对抗的鲁棒性。