论文
解锁基于 CLIP 的类增量学习的补丁级功能
Unlocking Patch-Level Features for CLIP-Based Class-Incremental Learning
摘要
类别增量学习(CIL)使模型能够不断整合新知识,同时减少灾难性遗忘。在 CLIP 卓越泛化的推动下,利用预先训练的视觉语言模型已成为 CIL 的主导范例。然而,当前的工作主要集中在将全局图像嵌入(即 [CLS] 词元)与其相应的文本提示(即 [EOS] 词元)对齐。尽管它们的性能良好,但我们发现它们丢弃了 CLIP 编码器固有的丰富的补丁级语义信息。例如,当识别兔子时,局部斑块可能会编码其独特的线索,例如长耳朵和毛茸茸的尾巴,这可以为识别提供补充证据。基于上述观察,我们为基于 CLIP 的 CIL 提出了 SPA(语义引导补丁级对齐),旨在唤醒 CLIP 中长期被忽视的局部表示。具体来说,对于每个类别,我们首先构建具有代表性和多样化的视觉样本,并将其输入 GPT-5 作为视觉指导,以生成按类别的语义描述。这些描述用于指导区分性补丁级视觉特征的选择。在这些选定的补丁的基础上,我们进一步采用最佳传输来将选定的补丁标记与来自类描述的语义标记对齐,从而产生结构化的跨模式对齐,从而提高识别能力。此外,我们引入了特定于任务的投影仪,以有效适应下游增量任务,并从存储的类高斯统计中采样伪特征来校准旧类表示,从而减轻灾难性遗忘。大量实验表明 SPA 实现了最先进的性能。