论文

ELAS:通过 2:4 激活稀疏性实现低秩 大语言模型 的高效 预训练

ELAS: Efficient Pre-Training of Low-Rank Large Language Models via 2:4 Activation Sparsity

模型优化稀疏化

摘要

大语言模型(LLM)已经取得了非凡的能力,但其在训练过程中巨大的计算需求仍然是广泛采用的关键瓶颈。近年来,低秩训练因其能够显着减少训练内存使用而受到关注。同时,将 2:4 结构化稀疏性应用于权重和激活,以利用 NVIDIA GPU 对 2:4 结构化稀疏格式的支持已成为一个有前途的方向。然而,现有的低秩方法通常将激活矩阵保留为满秩,这在大批量训练期间占据了内存消耗的主导地位并限制了吞吐量。此外,直接将稀疏性应用于权重通常会导致不可忽视的性能下降。为了实现 LLM 的高效 预训练,本文提出了 ELAS:通过 2:4 激活稀疏性实现低秩 LLM 的高效 预训练,这是一种通过 2:4 激活稀疏性实现低秩模型的新框架。 ELAS 将平方 ReLU 激活函数应用于低秩模型中的前馈网络,并在平方 ReLU 操作之后对激活实现 2:4 结构化稀疏性。我们通过 LLaMA 模型上的 预训练 实验评估了 ELAS,参数范围从 60M 到 1B。结果表明,在应用 2:4 激活稀疏性后,ELAS 保持了性能的最低限度下降,同时实现了训练和推理加速。此外,ELAS 减少了激活内存开销,尤其是在批量大小较大的情况下。代码可在 ELAS Repo 获取。