论文
适形跨模态主动学习
Conformal Cross-Modal Active Learning
摘要
视觉基础模型通过强大的预训练表示和强大的零样本能力改变了视觉识别,但其数据高效学习的潜力在很大程度上尚未开发。主动学习(AL)旨在通过策略性地选择信息最丰富的样本进行标记来最大限度地降低注释成本,但现有方法在很大程度上忽视了现代视觉语言模型(VLM)中嵌入的丰富的多模态知识。我们介绍了适形跨模态习得 (CCMA),这是一种新颖的 AL 框架,可通过师生架构连接视觉和语言模态。 CCMA 采用预训练的 VLM 作为教师,提供基于语义的不确定性估计,并进行共形校准,以指导仅视觉学生模型的样本选择。通过将多模态共形评分与多样性感知选择策略相结合,CCMA 在多个基准测试中实现了卓越的数据效率。我们的方法始终优于最先进的 AL 基线,与仅依赖不确定性或多样性指标的方法相比具有明显的优势。