论文
Ramen:具有主动样本选择的视觉语言模型的鲁棒测试时间适应
Ramen: Robust Test-Time Adaptation of Vision-Language Models with Active Sample Selection
摘要
CLIP 等预训练视觉语言模型表现出很强的零样本泛化能力,但对分布变化仍然敏感。测试时适应可以在推理过程中调整模型,而无需访问源数据或目标标签,从而提供了处理此类转变的实用方法。然而,现有方法通常假设测试样本来自单个一致的域,而在实践中,测试数据通常包括来自具有不同特征的混合域的样本。因此,它们的性能在混合域设置下会下降。为了解决这个问题,我们提出了 Ramen,一个通过主动样本选择来实现稳健的测试时间适应的框架。对于每个传入的测试样本,Ramen 根据两个标准从先前看到的数据中检索一批定制的相关样本:领域一致性,确保适应集中于来自相似领域的数据;预测平衡,减轻由偏差预测引起的适应偏差。为了提高效率,Ramen 采用嵌入梯度缓存来存储过去测试图像的嵌入和样本级梯度。存储的嵌入用于检索相关样本,并聚合相应的梯度以进行模型更新,从而无需任何额外的前向或后向传递。我们的理论分析提供了关于为什么所提出的适应机制在混合域转换下有效的见解。对多个图像损坏和域转移基准的实验表明,Ramen 实现了强大且一致的性能,在复杂的混合域场景中提供了强大且高效的适应。我们的代码可以在 https://github.com/baowenxuan/Ramen 获取。