论文
听、看、学:通过 SAM-Audio 学而不忘
Listen, Look, and Learn: Learning Without Forgetting through SAM-Audio
摘要
类别增量学习(CIL)旨在不断学习新类别而不忘记以前获得的知识。虽然最近 CIL 的进展引起了人们对各种模式的极大兴趣,但视听环境仍未得到充分探索。此外,尽管 SAM-Audio 等基础多模态模型封装了丰富的静态先验,但我们的实证分析表明,这些表示在增量设置中表现不佳。这项工作通过将 SAM-Audio 的视听先验集成到 CIL 设置中来弥补这一差距。具体来说,我们利用其密集的音频和视觉表示,并采用一种新颖的引导注意力策略,其中音频特征根据上下文引导视觉表示。为了进一步减轻灾难性遗忘,我们在特征和 logits 级别引入了双层 蒸馏 目标。对视听 CIL 基准的广泛评估表明,我们的方法始终优于最先进的方法。