论文
适应还是不适应?视觉语言模型的选择性适应
To Adapt or Not to Adapt? Selective Adaptation for Vision-Language Models
摘要
测试时间适应(TTA)已成为使视觉语言模型适应推理过程中分布变化的重要策略。我们对适应前后的模型预测进行了每个样本分析,并观察了现有 TTA 方法中与先前工作相呼应的两种故障模式。适应通常可以忽略不计,不会改变模型的预测,更严重的是,它们可能会因为将之前正确的预测翻转为错误的预测而产生有害影响。这自然提出了一个问题:我们能否识别并跳过这种可忽略不计或有害的适应?在这项工作中,我们引入了一个新的选择性适应问题,其目的是确定给定的测试样本是否应该进行适应或被跳过。为此,我们提出了交叉增强相似性(CAS),这是一个简单的基线,仅当跨增强视图的预测表现出低相似性时才执行适应。值得注意的是,即使跳过近 85% 的适应过程,CAS 不仅保留了整体准确性,而且在某些情况下还提高了整体准确性。我们希望其他研究人员能够探索这个新方向并超越我们基线的性能。我们的代码可在 https://github.com/sirujian/selective-adaptation 获取。