论文
随时进行无计划频谱优化训练
Anytime Training with Schedule-Free Spectral Optimization
摘要
标准神经网络训练依赖于与固定范围相关的学习率计划,导致强烈的路径依赖以及随着数据可用性变化而进行昂贵的重新调整。无调度 (SF) 方法通过删除显式调度来解决这个问题,但 SF-AdamW(当前最先进的随时优化器)始终低于经过良好调整的 AdamW 基线。我们提出了 SF-NorMuon,一种无调度的频谱优化器,它可以弥补这一差距:通过单个超参数配置,SF-NorMuon 在 $1$-$8\times$ Chinchilla 视野范围内的 125M 和 772M 参数语言模型上匹配或超过了经过调整的 AdamW,并且仅落后于水平感知、余弦调度的 NorMuon 仅 $\sim 0.03$ nat,大大缩小了任何时间之间的差距和预定的频谱优化器。在理论方面,我们证明了无计划谱动力学的平稳性保证,并确定快速迭代时的权重衰减对于长范围稳定性至关重要。 SF-NorMuon 使从业者能够在训练期间的任何时刻获得高质量的检查点,而无需提前承诺范围。在没有时间表的情况下完全匹配水平感知光谱优化器仍然是一个悬而未决的问题,我们将其作为未来工作的方向。通过调整 AdamW 基线缩小性能差距,SF-NorMuon 使无视野优化更加实用,朝着真正开放式、持续学习迈出了一步。