论文
扩散模型的优化器:受控基准
Optimizers for Diffusion Models: A Controlled Benchmark
摘要
离散扩散模型现在在多个基准上与自回归语言模型相匹配,而如何最好地训练它们的问题却很少受到关注:优化器从一篇论文继承到下一篇论文,并且从未进行比较。与此同时,新的优化器几乎完全在自回归预训练上进行验证,这是不同损失表面上的不同目标。我们提出了跨四种扩散公式的受控优化器基准,据我们所知,这是第一个离散扩散的基准:七个优化器(AdamW、Lion、Muon、SOAP、MARS、MARS-M、Schedule-Free),用于掩蔽扩散(text8)、均匀扩散(通过高斯对偶性的 QM9 和 LM1B)和图像上的高斯扩散(CelebA-64),每个优化器都针对具有已发布参考值的任务。每个优化器都接收相同的搜索协议,并且每个获胜者都使用三个种子以全部预算进行重新训练。 AdamW 是一个很强的默认值,但并不总是正确的选择:它在四个任务中的两个上被解决的余量击败,并且获胜者随着公式的变化而变化,因此优化器应该像训练配方的其余部分一样受到关注。值得注意的是,在自回归语言模型预训练上验证的方法迁移良好:Muon、MARS-M 和 SOAP 都在至少一种扩散公式上击败了经过调整的 AdamW。基准测试、所有运行和每个数字都可以从此 https URL 上发布的代码端到端地重现。