论文

在深度学习中何时使用 Schatten-$p$ 范数?

When to use what Schatten-$p$ norm in deep learning?

模型训练预训练

摘要

基于 Schatten-$\infty$ 的优化器(例如 Muon)已经显示出有希望的经验性能,但关于它们是否有益,仍然存在看似相互矛盾的观察。我们通过表明结论取决于政权来解决这一冲突。即使目标在 Schatten-$\infty$ 几何中是平滑的,较小的 Schatten-$p$ 几何也可能是最佳的,特别是在低维状态下,我们展示了包括 Chinchilla 缩放。这一结论是根据 $p>2$ 的 SODA 框架的新的抗噪声加速结果得出的。相同的分析解释了为什么类 Muon 方法不需要预热,为什么它们自然偏爱大批量,并产生任意 $p$ 的批量大小缩放规则。