论文

通过屏蔽双路径进行衰落侧网络的内存高效迁移学习 蒸馏

Memory-Efficient Transfer Learning with Fading Side Networks via Masked Dual Path Distillation

模型训练参数高效训练

摘要

内存高效迁移学习(METL)方法最近在使预训练模型适应下游任务方面取得了可喜的性能。他们避免在大型骨干网中应用梯度反向传播,从而显着减少 微调 期间可训练参数的数量和高内存消耗。然而,由于它们通常采用轻量级且可学习的侧网络,这些方法不可避免地在推理过程中引入额外的内存和时间开销,这与高效迁移学习的最终目标相矛盾。为了解决上述问题,我们提出了一种名为 Masked Dual Path 蒸馏 (MDPD) 的新颖方法,以加速推理,同时保留具有衰落侧网络的 微调 中的参数和内存效率。具体来说,MDPD 开发了一个框架,通过相互提取 微调 中的冻结主干和可学习的侧网络来增强性能,并在推理过程中丢弃侧网络而不牺牲准确性。此外,我们为多层编码器结构设计了一种新颖的基于特征的 知识蒸馏 方法。对仅视觉/语言和视觉和语言任务的不同主干进行的广泛实验表明,我们的方法不仅将推理速度提高了至少 25.2%,同时保持参数和内存消耗可比,而且与 SOTA 方法相比,还显着提高了准确性。源代码可在 https://github.com/Zhang-VKk/MDPD 获取。