论文
分层课程学习实现高效LLM压缩
Layer-wise Curriculum Learning for Efficient LLM Compression
摘要
在本文中,我们引入了分层课程学习以实现高效的大语言模型压缩。所提出的方法利用从更简单的优化任务开始并逐步解决更困难的任务的课程学习方法,促进了知识从教师模型到学生模型的迁移。为了在LLM压缩中采用分层学习,我们将整个模型划分为由层组成的多个部分,从而使LLM的知识迁移在计算上更加高效。基于我们对累积误差现象的理论分析,分层课程学习加速了收敛,同时稳定了知识转移过程。此外,我们提出了一种具有多线程策略的特征缓存方法,可以有效解决跨层的特征错位问题,从而最大限度地提高 GPU 利用率。因此,我们的方法展示了先进的模型压缩性能,以及在最小化内存使用和短训练时间方面的高计算效率。在多个数据集上的实验表明,所提出的方法实现了最先进的性能,同时在 BERT 和 GPT-2 上减少了 50% 以上的 GPU 内存使用和训练时间。此外,在相同的训练时间下,它在 LLaMA 系列和 Qwen 模型上的性能优于其他剪枝方法,并且 GPU 内存占用更低。