论文
迈向视觉语言模型的纯化多标签测试时间适应
Towards Purified Multi-Label Test-Time Adaptation of Vision-Language Models
摘要
测试时间适应(TTA)在单标签识别中得到了广泛的探索,可以有效地减轻分布变化,特别是与视觉语言模型结合使用时。然而,现实世界的图像通常包含多个对象,而更实用的多标签测试时间适应(MLTTA)迄今为止很少受到关注。最近基于缓存的 TTA 方法已经显示出有希望的效率和有效性,但直接将它们扩展到多标签场景会遇到一对多映射问题:纠缠共现对象的共享全局表示被存储为类缓存原型,从而导致主导标签偏差和妥协的缓存校准。虽然引入区域级线索有助于隔离特定类别的证据,但此类区域证据在分布变化下也可能不可靠,从而使其识别和利用变得非常重要。为了解决这些问题,我们引入了 PuRF,这是一种新颖的 PuRiFication 驱动的基于缓存的方法,用于视觉语言模型的多标签测试时适应。具体来说,PuRF 首先执行区域纯化以识别可靠区域,为多标签识别提供全面的区域线索并实现细粒度比对。基于这些净化区域,PuRF进行缓存净化以增强缓存表示和适应性,其中情景净化构建基于区分性区域的缓存,而临时刷新进一步促进长期缓存适应性。实验表明,PuRF 始终优于最先进的方法,在五个数据集上的 ViT-B/32 上实现了 4.05% 的 mAP 显着改进。