论文

SS-TPT:针对对抗性鲁棒视觉语言模型的稳定性和适用性引导的测试时间提示调整

SS-TPT: Stability and Suitability-Guided Test-Time Prompt Tuning for Adversarially Robust Vision-Language Models

模型训练参数高效训练

摘要

CLIP 等视觉语言模型 (VLM) 实现了强大的零样本识别,但在对抗性扰动下仍然非常脆弱。最近的测试时适应防御通过利用许多增强视图来提高鲁棒性,但这会导致不切实际的减速和明显的鲁棒性与吞吐量的权衡。为了应对这一挑战,我们提出了稳定性和适用性引导的测试时间提示调整(SS-TPT),通过两个互补的分数评估每个增强视图的质量:(1)稳定性,测量弱增强的预测不变性,(2)适用性,测量视图之间的特征空间密度。这些稳定性和适用性 (SS) 分数通过 SS 引导的一致性损失和 SS 加权预测来指导适应和推理,从而放大可信视图,同时抑制损坏的视图。大量实验表明,SS-TPT 显着优于先前最先进的方法,在不同数据集和不同数量的视图中实现了卓越的鲁棒性-吞吐量权衡,从而展示了强大的实用性和通用性。我们的代码可在 https://github.com/sunoh-kim/SS-TPT 获取。