论文

LLM中的激活压缩:理论分析和高效算法

Activation Compression in LLMs: Theoretical Analysis and Efficient Algorithm

模型训练参数高效训练

摘要

训练 大语言模型 (LLM) 是高度内存密集型的,因为训练不仅必须存储权重和优化器状态,​​还必须存储反向传播的中间激活。虽然现有的内存高效方法主要关注梯度和优化器状态,​​但由于缺乏 LLM 定制的理论和保证,激活压缩尚未得到很好的建立。在这项工作中,我们开发了一个理论框架,表明当激活压缩无偏时,激活压缩对于线性算子是安全的,但对于非线性算子来说是有问题的。我们进一步推导梯度方差界限,并在标准 $L$-平滑度假设下为所有线性算子应用激活压缩建立收敛保证,表明它不会改变收敛速度。在该理论的指导下,我们提出了一种激活梯度共压缩方法,该方法重用低秩激活因子来压缩线性层梯度,而无需额外的计算或额外的梯度误差。我们使用预训练基准和多个 微调 基准对 Qwen 和 LLaMA 模型进行了广泛的实验,以验证我们的理论并证明我们的方法在准确性和压缩效率方面的竞争性能。我们在补充材料中提供了代码以确保可重复性。