论文

低秩适应减少了顺序 Transformer 编码器中的灾难性遗忘 微调:受控经验证据和冻结骨干表示探针

Low-Rank Adaptation Reduces Catastrophic Forgetting in Sequential Transformer Encoder Fine-Tuning: Controlled Empirical Evidence and Frozen-Backbone Representation Probes

模型训练持续学习

摘要

预训练语言编码器的顺序 微调 通常会覆盖先前获得的功能,但参数高效更新的遗忘行为仍然没有得到充分表征。我们提出了对顺序 Transformer 编码器 微调 中的低秩适应 (LoRA) 的受控实证研究,并使用同伴表示探针来测试其鲁棒性的冻结骨干解释。在 RTE->MRPC->CoLA->SST-2 序列上的五次基于 BERT 的完全验证重新运行中,完整的 微调 产生 19.9%+/-4.8% 的平均遗忘,而标准 LoRA(r=8,查询/值模块)产生 0.6%+/-1.4%(配对 t 检验,p=0.002,Cohen 的d_s=3.12)。任务级分析证实,这种减少不仅仅是一种总体效应。 RoBERTa-base 的二次实验显示了相同的模式,最强的 EWC 基线仍保持在 15.5%+/-1.4% 遗忘率。六任务扩展揭示了低平均遗忘可以隐藏强大的任务级别异质性。一旦冻结参数超过大约 95%,细粒度冻结消融就会显示出明显的遗忘下降,仅分类器和浅适配器基线接近 LoRA。 GPT-2 和 RoBERTa 中的配套任务相似性探针显示了相同的方向性故事:冻结主干机制比完整的 微调 保留了更高的任务间相似性,逐渐解冻削弱了稳定性,完整的 微调 在最终的 Transformer 层表现出最明显的分歧。这些结果支持了一种有限的机械解释:LoRA 的帮助很大,因为骨干冻结保留了更稳定的共享特征支架。我们将标准 LoRA 定位为顺序编码器适应的强大经验基线,以及选择性可塑性如何在 Transformer 持续学习中形成干扰的有用探针。