Temperon:全职 SAM 质量,减少三分之一的挂钟
Temperon: Full-Time SAM Quality at a Third Less Wall-Clock
摘要
清晰度感知最小化(SAM)使每个训练步骤的成本增加了一倍,但它的好处集中在训练结束的地方。我们研究了昂贵的训练模式应该用在哪里,并提出了 Temperon:一个普通的 SGD 探索器,用于 epoch 预算的前 43%,然后一个预定的交接,将整个最终余弦退火交给 SAM 包裹的 Muon 精炼器。在 CIFAR-10/100、SVHN 和 Tiny ImageNet(五个种子,报告的时间为 epochs-to-target 时间乘以空闲 GPU 校准的 epoch 成本)上,Temperon 在所有准确度上都与最佳的全职 SAM 配方相匹配,同时在四个中的三个上更快地达到最难的共同目标 35%、34% 和 32%,并且在同等成本下比已发布的 SAM+SGD 配方高出一层。消融使归属变得准确:Muon 精炼器价值 +0.85pp,其他所有内容均固定;探索者的形状及其重新启动毫无价值,我们将其作为贡献撤回。以匹配的预算重新运行最接近的竞争对手后期 SAM 显示了边界:它对每个中级目标都是最快的,但任何种子中都没有 SGD 精炼方法达到 Muon 精炼器购买的层(CIFAR-100 上为 0.83,CIFAR-10 上为 0.97),而在 Tiny ImageNet 上,Muon 没有购买任何层,竞争对手只是获胜 - 该方法的测量边界。分配法则转移到 GPT-2 预训练(-29% 挂钟的全 SAM 质量)和 GLUE 微调(绝不会比全职 SAM 差,但 SAM 成本只有三分之一)。两个常数组织了经济学:提前跳过 SAM 会购买固定信用,而在所有四个数据集上,Muon 历元的成本是 SAM+SGD 历元的 1.50 倍。最后,切换不能根据轨迹来计时:在余弦调度下,精度曲线是平稳然后激增,因此信息存在于调度中,使得调度切换有原则性而不是方便性。代码和可安装 pip 的实现已发布。