论文

LEAP:大语言模型 的可学习端到端自适应剪枝

LEAP: Learnable End-to-End Adaptive Pruning of Large Language Models

摘要

非结构化稀疏性现在由最新的 GPU 内核和数据流硬件原生加速,将瓶颈从推理执行转移到剪枝算法。非结构化 LLM 剪枝的最先进方法是源自最佳脑外科医生原理的分层替代方法,它们牺牲了端到端的准确性,尤其是在极度稀疏的情况下。 MaskLLM 和 PATCH 等端到端替代方案表明,可学习的掩码可以缩小这一差距,但它们的分类模式参数化会随着每行有效掩码的数量而变化,并且不会移植到非结构化设置。我们引入了 LEAP,它用每个权重的 Bernoulli-via-Gumbel-sigmoid 松弛代替了这种棘手的参数化,使得端到端非结构化掩模学习变得易于处理。在 50% 和 60% 稀疏度下从 0.5B 到 8B 参数的五个 LLM 系列中,LEAP 比 ADMM(我们扫描中最好的逐层基线)平均提高了六任务平均零样本精度 +2.59 个点。