论文
SAGE:用于内存高效 LLM 优化的符号自适应梯度
SAGE: Sign-Adaptive Gradient for Memory-Efficient LLM Optimization
摘要
AdamW 优化器虽然是 LLM 预训练的标准,但它是一个关键的内存瓶颈,消耗的优化器状态相当于模型大小的两倍。尽管像 SinkGD 这样的轻态优化器试图解决这个问题,但我们发现了嵌入层的困境:这些方法无法处理嵌入固有的稀疏、高方差梯度,迫使混合设计恢复到 AdamW 并部分抵消内存增益。我们提出了 SAGE(Sign Adaptive GradiEnt),这是一种新颖的优化器,通过替换这种混合结构中的 AdamW 来解决这一困境。 SAGE 将 Lion 风格的更新方向与新的、内存高效的 $O(d)$ 自适应规模相结合。该尺度充当“安全阻尼器”,可证明以 1.0 为界,比现有方法更有效地抑制高方差维度。这种卓越的稳定性使 SAGE 能够实现更好的收敛。在参数高达 1.3B 的 Llama 模型上,我们基于 SAGE 的混合实现了新的最先进的困惑度,优于所有基线,包括 SinkGD 混合,同时显着减少了优化器状态内存。