论文
SHIFT-LLM:深度剪枝 LLM 中的分布偏移校正
SHIFT-LLM: Distribution Shift Correction in Depth-Pruned LLMs
摘要
深度剪枝删除了整个 Transformer 块以降低 大语言模型 的推理成本,但会破坏下游层预期的隐藏状态分布,从而导致严重的准确性损失。我们引入了 SHIFT-LLM,一种 无需训练 剪枝后校正框架,它在每个剪枝位点插入线性残差适配器(LRA)。每个 LRA 保留原始残差块的身份路径,并添加轻量级仿射残差校正。该校正通过小型保留集上的闭式最小二乘回归进行校准,无需梯度计算,以近似由修剪块产生的缺失残差更新。与保留的身份路径一起,最终的 LRA 输出近似于原始块产生的隐藏状态,从而减轻由层移除引入的分布不匹配,同时避免移除块的昂贵的注意力和前馈计算。由此产生的 LRA 支持低秩分解和跨连续剪枝层的精确合并,以实现额外的压缩,并与参数高效的 微调 自然地结合,以进一步恢复 微调 单独的剪枝模型。对五个模型系列、六个层选择标准和七个零样本基准的实验表明,SHIFT-LLM 一致地恢复了大多数配置中因深度剪枝而损失的精度,在 Llama-3.1-8B-Instruct 上实现了高达 +15.7 点的增益,同时仅需要几百个校准样本且无需梯度计算。