论文
CL-CLIP:基于 CLIP 的持续学习框架,具有用于对象检测的成本量类别解耦
CL-CLIP: CLIP-Based Continual Learning Framework with Cost-Volume Category Decoupling for Object Detection
摘要
持续对象检测(COD)要求检测器随着时间的推移获取新的类别,同时保留以前学习的类别。这个目标与开放词汇检测密切相关,因为这两种设置都需要对当前训练阶段可用注释未完全覆盖的类别进行推理。最近基于 CLIP 的开放词汇检测器表现出了强大的零样本泛化能力,F-ViT 等框架表明视觉语言预训练可以为看不见的类别提供强大的零样本检测能力。然而,现实世界的部署不能保持纯粹的零射击:一旦这些检测器不断更新新引入的类别,它们就会遭受严重的灾难性遗忘,并很快失去之前校准的检测能力。因此,我们提出了 CL-CLIP,一种基于 CLIP 的 COD 框架,通过成本量引导的类别解耦为开放词汇检测器提供更好的持续学习能力。具体来说,按照 CAT-Seg,我们计算 CLIP 图像文本相似度成本量,定义为视觉标记和类文本嵌入之间的密集类别响应图。这种零样本空间先验将共享区域特征分解为特定于类的路径,然后由多专家 RoI 头进行处理。在 PASCAL VOC 和 MS-COCO 上进行的大量实验表明,CL-CLIP 大幅提高了连续 微调 下的 F-ViT 基线,并实现了与现有连续目标检测器竞争的性能,特别是在适应新引入的类别的同时保持有竞争力的基类性能。