论文

最佳优化器取决于批量大小

The Best Optimizer Depends on Batch Size

模型训练预训练

摘要

大量新的自适应优化器旨在有效地估计和使用小批量梯度统计来调整参数更新,但它们通常以单个批量大小进行基准测试。超参数缩放规则有望在批量大小和梯度噪声变化时保持性能,这表明一种批量大小的最佳优化器应该在另一种批量大小下保持最佳状态。我们通过展示以下内容来挑战这种开发和评估优化器的方法:(1)没有原则性的 Muon 缩放规则在整个训练设置中一致工作,以及(2)即使在广泛的超参数调整之后,语言模型预训练的最佳优化器也会随着批量大小而变化。