论文

MARS:视觉语言模型的无监督长尾适配

Unsupervised Long-Tailed Adaptation of Vision-Language Models

模型训练监督微调与指令调优

摘要

通过利用未标记数据生成的伪标签,使视觉语言模型适应下游任务取得了显着的成功。现有方法通常假设均匀的未标记数据分布,因此所得的伪标签分布同样是均匀的。然而,现实世界的数据分布通常是长尾的。为了解决这个问题,我们正式提出了一个新的场景,称为无监督长尾适应(ULTA)。在这种情况下,现有方法表现出一种对比现象:头类性能急剧下降,这与尾类遭受最严重影响的监督长尾学习不同。特别是,我们发现分布不匹配不仅侵蚀头部类别边界,而且还将头部样本推入易混淆的类别,从而强化了模型的固有偏差。为了解决这些问题,我们提出了一种名为 Margin-Aware Refinement with Structural Alignment (MARS) 的新颖模型。具体来说,我们通过边界保留对齐来减轻头部边界侵蚀,它将零样本 VLM 作为固定视觉参考,以抑制训练目标中缺乏视觉支持的概率增加。在此基础上,我们引入了保证金感知自我细化,它采用动态调整策略来细化尾部和易混淆的类别,同时防止预测偏差。对 9 个基准数据集的大量实验表明,MARS 的性能优于最先进的方法,平均准确率提高了 4.71 个百分点。