论文
通过低秩重要性估计对 Transformer 进行资源高效剪枝
Resource-Efficient Pruning for Transformer via Low-Rank Importance Estimation
摘要
随着基于Transformer架构的大规模预训练语言模型的快速发展,其高计算和内存成本已成为部署的主要障碍,特别是在资源受限的环境中。传统的剪枝方法通常依赖于完全基于梯度的重要性估计,并且需要事先对模型进行微调才能获得满意的性能。此过程通常会导致无法忍受的资源消耗。本文提出了 REP-LIE,这是一种在微调过程中实现资源高效剪枝的新方法。 REP-LIE 利用 LoRA 低秩矩阵的梯度来估计权重的重要性,而不需要完整的梯度计算。为了解决重要性估计中固有的随机性,引入了稳定性得分,作为迭代剪枝不重要模型参数的基础。剪枝后的模型通过轻量级更新进一步进行微调,无需在微调过程中进行全参数优化。对中型编码器模型和大规模生成模型(LLaMA-7B 和 Mistral-7B)的大量实验表明,与现有方法相比,REP-LIE 仍然实现了具有竞争力的性能。