论文

小 LLM:修剪与从头开始训练

Small LLMs: Pruning vs. Training from Scratch

摘要

剪枝有望成为强大的小语言模型的捷径。在这项工作中,我们通过在两种受控词元匹配设置下使用涵盖深度、宽度和稀疏粒度的六种方法以 0.5--0.8 的修剪比率修剪 Llama-3.1-8B 来检验这一承诺。 (1) 使用相同的训练 词元预算,剪枝初始化始终优于随机初始化。这表明父模型提供了一个强有力的起点,尽管随着训练 词元预算 的增长和剪枝率的上升,优势逐渐缩小,在我们研究的最高剪枝率下几乎消失。 (2) 当从头开始训练时,考虑到整个管道消耗的完整 词元预算,更细粒度的剪枝仍然保留优势,而更粗的结构剪枝可以匹配或超越。这表明父模型传递的知识仅靠额外的训练词元无法完全恢复,但只能以细粒度恢复。综上所述,我们的结果得出了一个明确的建议:在手头有一个大型预训练模型和有限的训练 词元预算 的情况下,剪枝比从头开始训练更好;当训练预算不受限制时,从头开始的训练对于更粗的修剪来说可能具有竞争力,因此并不总是需要大量的预训练父代。