论文
VIS:仅用视觉分支进行基于CLIP的类别增量学习
Visual Branch is What You Need for CLIP-based Class-Incremental Learning
摘要
类别增量学习 (CIL) 要求模型能够随着时间的推移识别新类别,而不会忘记以前学过的类别。随着视觉语言预训练的兴起,CLIP 已成为 CIL 的坚实基础。基于 CLIP 的 CIL 中的常见设计是通过使用 CLIP 文本编码器对类名模板进行编码来构造文本分类器权重,然后通过图像文本余弦相似度对视觉特征进行分类。这种设计很有吸引力:由于 CLIP 在共享嵌入空间中对齐图像和文本,文本权重似乎为增量类提供了现成的分类器。然而,我们表明,这种看似自然的设计并不总是有益的,因为模态间隙仍然可以将两种模态分开,并使文本分类器权重偏离视觉类分布。根据经验,在相同的任务方式 CIL 训练下,使用视觉类中心初始化余弦分类器比使用 CLIP 文本特征产生更低的损失和更好的增量准确性。受这些观察的启发,我们提出了 VIS,这是一种基于 CLIP 的 CIL 的纯视觉方法,它删除了部署的文本分支并完全在视觉空间中构建增量分类器。为了获得更强的任务自适应视觉表示,VIS 仅使用基础会话数据来通过信息丰富的视觉层特征来增强 CLIP 的最终视觉表示。 VIS 基于增强的视觉表示,采用简单的核化增量最小二乘 SVM,其分类器权重通过加法充分统计以封闭形式求解。当新类别到达时,VIS 会积累足够的统计数据并重新计算所有已看到类别的分类器权重,从而在保留历史类别知识的同时实现高效的增量更新。大量实验表明,VIS 在没有文本分支的情况下实现了最先进的性能。