论文

当 Muon 遇到任务干扰:持续学习和模型合并的光谱视角

When Muon Meets Task Interference: A Spectral Perspective on Continual Learning and Model Merging

模型训练持续学习

摘要

持续学习(CL)和模型合并(MM)都旨在获得在多个任务中表现良好的单一模型,分别面临灾难性遗忘和权重解缠错误的挑战。在文献中,这些困难只是单独处理并通过各种解决方案来缓解,而基础优化器引起的几何形状被视为实现细节。在这项工作中,我们表明这两个困难实际上是同一现象的两个实例:对一项任务有用的参数更新会将模型的输出转移到另一项任务上。我们将这种共享现象形式化为 \textit{任务干扰} 并将其简化为常见的分层 Frobenius 内积 $\langle ΔW_\ell, J_\ell(x)\rangle_F$。反过来,这个数量被用来揭示优化器的作用。我们从理论上推导了一个上限,该上限将谱范数 $\|ΔW_\ell\|_2$ 隔离为任务干扰的优化器可控因素,并且每个模式分析表明该上限跟踪经验干扰的主要部分。具体来说,我们然后将最近的 Muon 优化器确定为一种通过构建来调节该因素的机制。我们的工作表明,它对光谱范数的优雅控制收紧了 CL 和 MM 的干扰界限,将 Muon 定位为一种有原则的以优化器为中心的方法,对现有解​​决方案进行补充。我们的理论分析得到了实验结果的充分验证。在三个 CLIP 主干网的八任务模型合并基准上,用 Muon 替换 AdamW 优化器可将准确性提高高达 +5.02 点。为了持续学习,Muon 还在 10 个类增量协议、3 个任务增量协议和 11 个任务 MTIL 基准测试中提供了一致的正收益。