论文

POP:在线结构化剪枝实现大型基础模型的高效推理

POP: Online Structural Pruning Enables Efficient Inference of Large Foundation Models

摘要

大型基础模型(LFM)通过扩展取得强劲性能,但当前的结构化剪枝方法在推理期间得出固定的剪枝决策,忽视了自回归 token 生成中出现的稀疏模式。本文提出 POP(Partition-guided Online Pruning,分区引导在线剪枝),一个高效的在线结构化剪枝框架,能以极小的计算开销实现条件于上下文的动态剪枝。POP 将模型通道划分为保留、候选与已剪枝区域:预填充(prefilling)阶段定义粗粒度剪枝分区,解码阶段在候选区域内生成细粒度掩码,避免对所有通道重新评估。粗粒度剪枝分区保留持续重要的权重,而细粒度掩码在解码期间提供随上下文变化的调整。此外,POP 是一种轻量的即插即用方法,不需要任何预处理,包括离线校准、重训练或学习预测器。在多种 LFM(包括大语言模型(LLM)、混合专家模型(MoE)与视觉语言模型(VLM))上的大量评估表明,POP 始终比现有剪枝方法取得更高准确率,同时计算开销更小并将推理延迟降到最低。

POP:在线结构化剪枝实现大型基础模型的高效推理
图1:Llama2-7B 上跨各基准的按任务归一化性能,以及推理效率。与基线剪枝方法相比,POP 在各任务上表现出更一致的性能,同时保持更高的效率。