论文

Adam 持续学习中梯度修改的隐藏故障模式和自适应解耦矩路由修复

Hidden Failure Modes of Gradient Modification under Adam in Continual Learning, and Adaptive Decoupled Moment Routing as a Repair

模型训练持续学习

摘要

许多持续学习方法会修改上游梯度(例如,投影、惩罚重新缩放、重放混合),同时将 Adam 视为中立后端。我们证明这种组合具有隐藏的故障模式。在高重叠、非自适应 8 域连续 LM 中,所有共享路由投影基线都崩溃到接近普通遗忘(12.5--12.8 与 13.2)。 0.5% 的重放缓冲区是最强的共享替代方案,但仍达到 11.6,而固定强度解耦则低于普通的 14.1。只有自适应解耦路由保持稳定在 9.4,比普通路由提高了 3.8 个单位。在 16 域流上,其相对于最强共享路由投影基线的增益增长至 4.5--4.8 个单位。在干净的基准测试中,故障基本上是不可见的。我们通过 Adam 的二阶矩路径解释了这种效应:在测试的情况下,投影会导致旧方向有效学习率出现 1/(1-alpha) 膨胀,在 8 个 alpha 值中匹配测量结果在 8% 以内。同样的冲突也出现在惩罚方法、重放混合以及 LoRA 下的 7B 规模上。我们的修复仅将修改后的梯度路由到第一时刻,同时保留大小忠实的第二时刻统计数据,并具有重叠感知自适应强度。这个简单的更改是唯一经过测试的配置,可以始终避免跨方法、优化器和规模的崩溃。