论文
用于快速稳定零阶训练的探针空间预处理
Probe-Space Preconditioning for Fast and Stable Zero-Order Training
摘要
反向传播(BP)在深度学习中占主导地位,但会带来巨大的内存负担。例如,使用 Adam 训练 OPT-30B 需要约 600GB 的 GPU 内存(假设批量大小为 8,序列长度为 2048)。或者,零阶优化 (ZOO) 在推理模式下进行训练(同一模型仅需要 $\approx$ 60GB):没有存储的激活,没有梯度,也没有优化器状态。然而,ZOO的收敛性却落后于BP。在这项工作中,我们评估了两种方法来缩小这一差距。首先,我们表明,将训练计算预算从许多步骤重新分配到具有许多扰动(或探测)但步骤较少的大有效批量大小,使得 1SPSA(Spall,1992)能够以更少的训练计算优于 MeZO(Malladi 等人,2023)等零阶方法。接下来,我们介绍 1.5-SPSA,在 1SPSA 中每步添加一个“干净”的前向传播,以在探测空间中计算廉价的对角预处理器,从而通过降低高曲率方向的权重来提高收敛速度和收敛性。对 Qwen3 和 OPT 模型系列上的 6 个训练后数据集进行基准测试,我们表明 1.5-SPSA 比以前的 ZOO 求解器以更少的优化步骤实现了最先进的结果。例如,我们训练 OPT-13B(与 MeZO 直接比较),发现 1.5-SPSA 在 SST-2 上仅用 70 步就比 MeZO 和 BP 实现了 +3.1% 的准确率,而 MeZO 则需要 100,000 步。最后,我们结合了 8 位打包随机生成器、triton 融合解包/应用内核和分布式并行性,以在商用 GPU(例如 A100)上实现对 OPT-30B 等大型模型的快速稳定训练。