论文
Muon-OGD:用于 LLM 持续学习的基于 Muon 的光谱正交梯度投影
Muon-OGD: Muon-based Spectral Orthogonal Gradient Projection for LLM Continual Learning
摘要
大语言模型 (LLM) 持续学习的一个核心挑战是灾难性遗忘,适应新任务可能会大大降低以前学过的任务的表现。现有的基于投影的方法通过限制参数更新到与过去任务相关的方向正交的子空间来减轻这种干扰。然而,这些方法通常是在欧几里得参数几何下制定的,更新幅度和投影由弗罗贝尼乌斯范数控制。 Muon 优化器最近的经验成功表明,Frobenius 几何可能不是矩阵值 LLM 参数的最有效选择,该优化器应用正交矩阵更新并承认谱范数解释。受这一观察的启发,我们提出了 Muon-OGD,这是一种谱范数感知的持续学习框架,它将 Muon 式算子范数几何与正交投影约束集成在一起。我们的方法将每次更新表示为具有线性非干扰约束的谱范数约束优化问题,并通过对偶迭代和 Newton-Schulz 矩阵符号近似有效地解决它。通过应用正交动量更新来避免与先前任务相关的受保护方向,Muon-OGD 旨在提高连续 LLM 适应中的稳定性-可塑性权衡。我们使用编码器-解码器和仅解码器架构在标准持续学习基准、TRACE 和特定领域的编码-数学-医学课程上评估所提出的方法。根据经验,Muon-OGD 始终优于顺序 微调 和竞争性正交梯度基线,同时保持计算可扩展性。这些结果表明,谱范数感知更新几何为 Frobenius 范数投影提供了一种实用且有效的替代方案,用于 LLM 中的持续学习。