论文

解决无源跨域小样本学习的加剧注意力下沉问题

Addressing Exacerbated Attention Sink for Source-Free Cross-Domain Few-Shot Learning

模型训练监督微调与指令调优

摘要

像 CLIP 这样的视觉语言模型 (VLM) 已经表现出了令人印象深刻的泛化能力,但其跨域少样本学习 (CDFSL) 的潜力仍未得到充分开发,其中模型需要将源域信息传输到训练数据稀缺的目标域。虽然在某些任务的 VLM 中观察到了注意力集中现象,但它在 CDFSL 场景中的作用尚未被研究。在本文中,我们发现了先前工作中忽视的一个关键问题:CDFSL 中的标准目标域少样本 微调 显着加剧了注意力下沉问题,导致跨类别的区分性较差。为了理解这种现象,通过大量的实验,我们将其解释为模型的域适应捷径学习:为了克服源域和目标域之间巨大的域差距,模型表现出很高的倾向,将最初更接近目标域类的标记(即简单标记)推向更接近这些类,从而加剧了注意力下沉并浪费了学习其他有辨别力但最初更进一步的标记(即硬标记)的能力。为了解决这个问题,我们提出了一种在目标域微调期间根据词元与目标域类的相关性动态重新加权词元的新方法,该方法显式抑制模型对这些简单词元的依赖并增强硬词元的学习,减少接收器词元并增强可辨别性。对四个基准数据集的广泛实验验证了我们方法的基本原理,展示了新的最先进的性能。我们的代码可在 https://github.com/shuaiyi308/TIR 获取。