论文

领域转变下的广义类别发现:从视觉到视觉语言模型

Generalized Category Discovery under Domain Shifts: From Vision to Vision-Language Models

模型训练参数高效训练

摘要

广义类别发现(GCD)旨在通过从已知类的标记数据转移知识来对已知和未知类中的未标记实例进行分类。现有方法假设所有数据都来自单个域,但现实世界中未标记的数据通常会随着语义变化而表现出域变化。我们研究领域转移下的 GCD,并提出了三个适应基础模型的框架,从自监督视觉模型到视觉语言模型。 (i) HiLo 通过多级特征提取和互信息最小化,结合 PatchMix 增强和课程抽样,解开领域和语义特征。 (ii) HLPrompt 通过语义感知空间提示调整扩展了 HiLo,以抑制背景和域噪声。 (iii) VLPrompt 通过分解文本提示和跨模式一致性正则化来利用视觉语言模型。这三种方法共享核心设计原则,同时运行在不同的基础骨干上,从而适用于不同的部署场景。对合成腐败和现实世界多域转移的广泛实验表明,在强大的基线上取得了一致的改进。项目页面:https://visual-ai.github.io/hilo/