论文
通过测试时提示适应来增强视觉语言模型
Robustifying Vision-Language Models via Test-Time Prompt Adaptation
摘要
CLIP 等预训练视觉语言模型 (VLM) 实现了强大的零样本泛化,但它们的性能在对抗性扰动下急剧下降。现有的测试时间适应方法通常依赖于样本级置信启发法,忽略了数据的内在分布结构。这种以样本为中心的方法限制了鲁棒性,因为它无法区分可信的对抗性错误预测和真正的语义一致性。在这项工作中,我们观察到对抗性扭曲在结构上是脆弱的:虽然整体表示被破坏,但语义完整性通常在增强视图的分布中得以保留。受这一见解的启发,我们提出了 RITA,这是一个鲁棒的测试时间提示适应框架,从样本级别估计转向分布级别对齐。具体来说,RITA 采用最佳传输来将增强视觉特征的分布与文本原型对齐,减少对抗性异常值并纠正跨模式语义错位。此外,我们引入了动态缓存,以逐步积累来自测试流的可靠线索,以进行在线优化。大量实验表明,RITA 显着提高了对抗鲁棒性,同时又不影响干净的准确性。