论文

基于原型的视觉语言模型测试时适应

Prototype-Based Test-Time Adaptation of Vision-Language Models

模型训练参数高效训练

摘要

测试时间适应 (TTA) 已成为视觉语言模型 (VLM) 的一个有前途的范例,以弥合 预训练 和测试数据之间的分布差距。最近的工作重点是依赖于基于缓存的设计的无反向传播 TTA 方法,但这些方法引入了两个关键限制。首先,随着缓存随着类数量的增加而增加,推理延迟也会增加,从而导致大规模设置中的效率低下。其次,当缓存包含不足或不正确的样本时,会出现性能次优的情况。在本文中,我们提出了基于原型的测试时间适应(PTA),这是一种高效且有效的 TTA 范式,它使用一组特定于类的知识原型从测试样本中积累知识。特别地,基于每个测试样本的零样本类别置信度对知识原型进行自适应加权,将样本的视觉特征合并到相应的特定类别原型中。值得强调的是,来自过去测试样本的知识仅在原型中集成和利用,消除了阻碍现有 TTA 方法效率的缓存填充和检索的开销。这赋予了 PTA 极高的效率,同时在 15 个图像识别基准和 4 个强大的点云分析基准上实现了最先进的性能。例如,PTA 在 10 个跨域基准上将 CLIP 的准确率从 65.64% 提高到 69.38%,同时在大规模 ImageNet-1K 上保留了 CLIP 92% 的推理速度。相比之下,基于缓存的 TDA 的准确度较低,为 67.97%,并且运行速度仅为 CLIP 的 50%。