论文

M+Adam:通过加法-乘法优化进行低精度训练

M+Adam: Low-Precision Training via Additive-Multiplicative Optimization

模型训练预训练

摘要

使用量化权重进行训练可以降低成本,但通常会导致准确性下降,特别是在低精度下进行优化而不存储高精度副本时。我们确定了一个关键的故障模式:在低精度下,标准优化器可能会陷入困境而无法取得进展,特别是在由于尾数分辨率粗糙而导致权重较大的情况下。为了克服这个问题,之前已经提出了乘法更新来代替标准优化器中的加法更新。虽然在极低精度下(例如在对数系统下)成功,但它们会在接近零和符号变化时出现故障。因此,加法更新和乘法更新的故障模式是互补的。为了利用这一点,我们提出了 M+Adam,它结合了两种更新类型:加法步骤处理符号变化和小幅度,而乘法步骤确保当加法更新在舍入下归零时在大幅度上取得进展。我们在标准平滑度假设下证明了 M+Adam 的单调下降。在使用 60M-1B 模型、1x-8x Chinchilla 预算并仅使用 BF16、FP8 和 FP4 主权重的 LLaMA 式预训练中,M+Adam 持续改进了低精度训练。