论文

TAME:通过混合专家对视觉语言模型进行测试时对抗性提示调整

TAME: Test-Time Adversarial Prompt Tuning via Mixture-of-Experts for Vision-Language Models

摘要

大规模预训练视觉语言模型(VLM),例如 CLIP,表现出强大的零样本泛化能力,但仍然很容易受到难以察觉的对抗性扰动的影响,从而引发了开放世界部署的严重安全问题。为了增强鲁棒性而不需要下游特定任务的再训练,我们提出了 TAME,一种新颖的测试时防御。在我们之前的测试时对抗性提示调整 (TAPT) 的基础上,TAME 通过用输入条件混合专家 (MoE) 框架替换 TAPT 的单一自适应提示,引入了架构重构,从而实现更具表现力和适应性的防御。具体来说,TAME 维护了一系列可学习的专家提示,并采用依赖于输入的路由机制在推理时为每个未标记的测试样本聚合定制的提示混合物。这种测试时防御机制由三个无监督目标驱动:(1) 多视图预测熵最小化,(2) 视觉标记统计数据与预先计算的干净和对抗性参考分布的分层对齐,以及 (3) MoE 正则化,以平衡专家利用率和提示多样性。我们在 11 个基准数据集(包括 ImageNet 和 10 个其他零样本数据集)上评估了 TAME。结果表明,TAME 在 AutoAttack 下将原始 CLIP 的零样本对抗鲁棒性提高了至少 49.1%,同时在很大程度上保留了对干净样本的泛化能力。 TAME 在多个提示设计中也始终优于现有的对抗性提示调整方法,平均鲁棒性增益至少为 30.2%。