论文

AutoCompress:关键层隔离以实现高效 Transformer 压缩

AutoCompress: Critical Layer Isolation for Efficient Transformer Compression

模型优化模型压缩

摘要

我们提出了 AutoCompress,这是一种基于经验发现的 Transformer 压缩方法:在小型 Transformer 中,第 0 层携带了不成比例的高任务关键信息,基于 NTK 的重要性得分为 3.6,而所有其他层的最大值为 0.054,差距超过 60 倍。基于这一发现,我们提出了关键层隔离(CLI),这是一种全维度保护第 0 层的架构,通过学习的瓶颈压缩所有中间层,并在最后一层恢复全维度。应用于 GPT-2 Medium(354.8M 参数)时,CLI-GPT2 在 WikiText-103 上仅用 143.8M 参数就实现了 204.5 的困惑度——压缩比提高了 2.47 倍,参数减少了 59.5%。至关重要的是,消融研究表明,在相同的训练条件下,同等大小的统一瓶颈基线仅实现 571.8 的困惑度,这证实了保护第 0 层的架构决策(而不是简单地减小模型大小)是性能的主要驱动因素。代码和检查点是公开的。