论文

学习不该学的内容:针对鲁棒视觉语言模型的对抗性解缠提示调整

Learning What Not to Learn: Adversarial Disentangled Prompt Tuning for Robust Vision-Language Models

模型训练参数高效训练

摘要

虽然对抗性提示调整可以有效增强视觉语言模型的鲁棒性,但我们发现现有方法加剧了对已见类的鲁棒泛化过度拟合,导致随着训练的进行,针对未见类的对抗性示例的性能迅速下降。我们凭经验确定这种退化源于模型学习伪鲁棒特征(即不可概括的捷径)的倾向。为了缓解这个问题,我们提出了 ADAPT(Adversarial Disentangled Prompt Tuning),这是一个遵循“学习不该学的东西”理念的强大的提示调整框架。具体来说,ADAPT 使用双提示机制,其中包含目标提示和诱饵提示池。在训练过程中,引导诱饵提示捕获各种伪鲁棒特征,而目标提示被限制为与嵌入空间中的诱饵正交,以学习鲁棒特征。通过将鲁棒特征与伪鲁棒特征分开,ADAPT 可以有效防止鲁棒泛化过拟合。我们进一步提供的分析表明,正交损失限制了伪鲁棒特征的变化对不可见类的影响,从而产生了测试误差保证。根据经验,大量实验表明 ADAPT 极大地提高了目标提示对未见过的类的鲁棒性。该代码可从 https://github.com/cheny02/ADAPT-ACMMM2026 获取。