论文

干净:通过 Nyström 草图以线性记忆成本计算二阶LLM训练

Clean: Second-order LLM Training at Linear Memory Cost via Nyström Sketching

模型训练预训练

摘要

训练大语言模型 (LLM) 需要一个基本的权衡:记忆高效优化器(例如 Adam)丢弃跨参数曲率,而全曲率方法(例如 SOAP)可以以令人望而却步的记忆成本加速收敛。我们推出了 Clean,一个记忆高效且全曲率的优化器,旨在解决这个瓶颈。 Clean 利用随机 Nystrom 方法精确近似 SOAP 中的左右预处理器,并将优化器的记忆复杂度从模型维度的二次降低到线性。随后,我们重新集成子空间外组件,以捕获超出低秩近似值的曲率信息,以最小的记忆成本保留丰富的曲率。我们进一步提出 Q-Clean,一种低精度变体,可积极压缩优化器状态。当预训练为 LLaMA-1.3B 架构时,与 Muon 相比,Q-Clean 将优化器记忆的消耗减少了 超过 50\%,同时保持了强大且有竞争力的预测性能。值得注意的是,与标准 AdamW 相比,Clean 的优化器状态占用空间更小,同时在挂钟时间内达到 AdamW 的最终性能快 26\%。此外,我们的方法独特地在单个 80GB GPU 上启用 13B-参数模型的预训练,为大规模模型优化提供可扩展、高效且可访问的方法。