论文
迈向细粒度鲁棒性:视觉语言模型的注意力引导测试时提示调整
Towards Fine-Grained Robustness: Attention-Guided Test-Time Prompt Tuning for Vision-Language Models
摘要
视觉语言模型 (VLM),例如 CLIP,已经通过各种 微调 适应方法在下游任务上实现了显着的零样本性能。然而,最近的研究证明,对抗性攻击会显着降低 VLM 的推理能力,对其实际应用构成重大风险。流行的测试时适应方法通常依赖于多视图增强来实现各种 微调 策略,这些策略很难识别语义信息,并且容易破坏细粒度场景中的判别区域。为了解决这些限制,我们提出了注意力引导测试时间提示调整(A-TPT),这是一种为测试时间适应而设计的语义保留方法。我们首先完善梯度注意力传播机制,以识别在对抗性攻击下幸存的语义上有意义的区域。此外,我们利用它们来指导空间变化的增强强度和多视图集成,以进行快速调整和推理。大量实验表明,A-TPT 在对抗性数据和干净数据上都优于现有的测试时间适应方法。代码可在 https://github.com/SEU-VIPGroup/A-TPT 获取。