论文

为无源跨域小样本学习找回丢失的文本层

Reclaiming Lost Text Layers for Source-Free Cross-Domain Few-Shot Learning

模型训练监督微调与指令调优

摘要

无源跨域小样本学习(SF-CDFSL)关注用目标域(如医学或卫星图像)的有限训练数据进行微调,CLIP近来因对下游任务的泛化能力在这一任务上展现出可观结果。现有工作指出CLIP的文本编码器更适合跨域任务,但我们发现,移除文本编码器的某些中间层能有效提升SF-CDFSL的性能,我们称之为Lost Layers。本文深入探究这一现象以获得更深理解。我们发现,这些层中的信息其实对SF-CDFSL任务是有益的而非有害的,只是视觉差距使这些有用信息无法被充分利用,使这些层显得冗余。基于这一理解,不同于简单地移除这些层的现有做法,我们提出一种在层和编码器两个层面教导模型重新利用这些丢失层信息的方法,在域偏移下引导视觉分支的再学习。我们的方法有效解决了文本编码器中信息利用不足的问题。在各种设置、主干(CLIP、SigLip、PE-Core)和任务(4个CDFSL数据集和10个Meta-dataset数据集)上的大量实验证明了我们方法的有效性。代码发布于https://github.com/zhenyuZ-HUST/CVPR26-VtT。

为无源跨域小样本学习找回丢失的文本层
图3:(a) VtT模型的总体架构。首先,V-T Fusion模块在层级上整合视觉与文本特征(黄色线)。随后,TIA模块在编码器层级吸收来自文本编码器的信息(粉色线)。最后,DGSO模块利用前述模块的输出与梯度信息优化模型(橙色线)。(b) V-T Fusion模块将视觉编码器与文本编码器的输出从深层到浅层交错排列,并使用SSM网络进行整合。(c) DGSO模块在优化模型之前移除与主任务(分类)相冲突的梯度。它还根据梯度冲突的程度决定何时停止使用VtT模型。