论文

Muon 可以胜过专用的持续学习方法

Muon Can Outperform Dedicated Continual Learning Methods

模型训练持续学习

摘要

使用低秩适配器(LoRA)的持续学习通常会通过惩罚新更新与累积的过去权重之间的重叠来减少遗忘,这会阻碍某些更新方向,而无法控制更新如何将其能量分配给剩余的更新。我们询问该限制是否必须具有任务感知能力,或者优化器提供的通用限制是否足够。我们使用 Muon 训练一个普通增量 LoRA (IncLoRA),它对每次更新进行正交化,并将其与标准 CL 基准上的五个种子和三个任务顺序以及 TRACE 上的三个种子上的 O-LoRA 和 ELLA 进行比较。 IncLoRA+Muon 达到了标准 CL 上专用方法的精度带,并改进了 TRACE 上的每个 AdamW 配置。一种更新约束机制就足够了,无论它来自损失还是来自优化器;在标准 CL 上,第二个方法没有帮助,对于最严格的方法来说,它需要花费 8.4 点的准确性和可塑性来适应每项任务。两个优化器的区别不在于更新的大小(Muon 下的更新大小是 AdamW 下的 0.91 到 2.06 倍),而是更新的分布方式。 AdamW 将其限制在 1.4 到 1.8 之间的有效奇异方向,Muon 将其扩展到 7.0 以上,并且两者在任何跟踪运行中都不会重叠。因此,通常归因于专用 CL 方法的部分优势可以通过优化器更新的几何结构来解释。