论文

IrekoGPT:将结构化修剪转变为事后可精简大语言模型

IrekoGPT: Turning Structured Pruning into Post-Hoc Slimmable LLMs

摘要

我们引入了 IrekoGPT,这是一种事后方法,用于将预训练的 LLM 转换为可精简模型,其宽度可以在推理时调整。在 SliceGPT 的基础上,我们保留其投影矩阵而不对其进行修剪,从而允许单个模型以不同的宽度公开嵌套子网络。我们通过跨多个压缩比校准每个层来提高鲁棒性,并通过无梯度岭回归纠正下游线性层。在 Llama 和 Qwen 模型中,初步结果显示,与基于 PCA 的原始瘦身相比有所改进,在高压缩时收益最大。代码可在 https://github.com/aimagelab/IrekoGPT 获取