论文

利用视觉语言模型作为主动学习中的弱注释器

Leveraging Vision-Language Models as Weak Annotators in Active Learning

模型训练合成数据

摘要

主动学习旨在通过在有限的标记预算下选择性地查询信息样本进行监督来降低注释成本。在这项工作中,我们研究了如何利用视觉语言模型(VLM)来进一步减少主动学习范式中对昂贵的人工注释的依赖。为此,我们发现,在细粒度识别任务中,VLM 的可靠性随标签粒度的不同而显着变化:它们在细粒度标签上表现不佳,但可以提供准确的粗粒度标签。利用这一特性,我们提出了一个主动学习框架,通过实例标签分配将细粒度的人类注释与粗粒度的 VLM 生成的弱标签相结合。我们使用一小组可信的完整标签进一步对 VLM 生成的标签中的系统噪声进行建模。 CUB200 和 FGVC-Aircraft 上的实验表明,在相同的注释预算下,所提出的框架始终优于现有的主动学习方法。