论文
是什么推动了 CLIP 测试时的适应?更新视角下的对照实证研究
What Drives Test-Time Adaptation for CLIP? A Controlled Empirical Study from an Update Perspective
摘要
CLIP 等视觉语言模型 (VLM) 已成为开放词汇识别的标准支柱,但其零样本预测仍然容易受到部署时遇到的分布变化的影响。测试时间适应 (TTA) 最近已作为轻量级解决方案扩展到 CLIP,从而导致 TTA4CLIP 方法快速增长。然而,这一领域的实证进展在很大程度上超出了我们对真正推动适应的因素、其收益源自何处以及在哪些转变下它们仍然可靠的理解。在本文中,我们退一步追求最先进的精度,并对 TTA4CLIP 进行系统的对照研究。我们首先根据测试时的更新内容将现有方法组织成三个统一的范式。然后我们介绍了 TTABC,它是 CLIP 的开源 TTA Benchmark,它标准化了评估协议并集成了 20 多种代表性方法。我们的受控实证分析侧重于三个关键领域。首先,我们确定基于参数的方法中的驱动因素,揭示适应增益主要由测试时证据和可靠的代理驱动,而不是大量优化。其次,我们探索了重参数调整之外的证据利用,表明可以通过交叉或当前样本证据和轻量级原型更新来实现有竞争力和高效的性能。最后,我们证明 TTA 没有灵丹妙药:没有单一的适应范式是普遍最优的,首选范式取决于转变的性质。我们希望我们的基准测试和研究能够更清楚地了解当前的 TTA4CLIP 格局,并为进一步研究奠定基础。