论文

规模不变优化何时变得不稳定?具有重量衰减的精确时间表定律

When Does Scale-Invariant Optimization Become Unstable? An Exact Schedule Law with Weight Decay

模型训练预训练

摘要

归一化使神经网络的大部分有效地保持尺度不变,从而引入隐藏的反馈循环,其中学习率计划和权重衰减通过参数范数相互作用,以控制优化器采取的有效步骤。我们表明,这种相互作用受到精确的离散时间定律的控制:单个标量捕获所有调度和衰变强迫,而范数增长则引发相反的几何自猝灭效应。这产生了一个清晰的边界,可以清楚地区分收缩主导和扩张主导的有效学习率机制。为了理解底层机制,我们对完全求解的归一化回归模型进行了精确分析,其中动态减少到二维,并表明平衡点本质上不稳定,这意味着带有权重衰减的恒定学习率不能稳定地维持内部平衡,而是产生由离散时间雅可比结构驱动的循环行为。我们通过统一的同质优化器框架进一步将这一观点扩展到优化器,该框架揭示了自猝灭强度的结构二分法,为为什么自适应方法在归一化下表现出系统性较弱的稳定性提供了第一原理解释。在动态系统和神经网络(MLP、CNN、GPT2 / MNIST、CIFAR、wikiText、OpenWebText)中,预测定律具有高精度,并且能够通过识别的标量直接控制训练,性能在预测边界处急剧达到峰值。总之,这些结果隔离了用于尺度不变优化的单个控制量,为现代深度学习中的训练动态、优化器行为和调度设计提供了精确且可操作的视角。代码可在 https://github.com/shasanamin/normalized-optimization-dynamics 中找到。