论文
批量自适应剪枝:语言推理模型的周期性神经元激活感知权重剪枝
Batch-wise Adaptive Pruning: Periodic Neuron Activation-Aware Weight Pruning for Language Reasoning Model
摘要
大型推理模型(LRM)通过扩展的思想链生成在复杂任务上实现了强大的性能,但在推理过程中会产生大量的计算成本。在生产环境中,批量推理对于高吞吐量至关重要,但我们评估的现有 无需训练 自适应修剪方法在这种情况下严重退化。由于批次必须共享单个修剪掩码,因此这些方法会聚合样本之间的激活,然后应用基于阈值的选择;在未聚合激活上离线校准的阈值不再与聚合分布匹配,因此实现的稀疏率会发生漂移,并且在批量推理下推理任务的准确性会崩溃。在这项工作中,我们提出了一种专为 LRM 中的批量推理而设计的 无需训练 自适应剪枝方法,该方法基于两个组件构建。首先,我们将基于阈值的选择替换为对聚合重要性分数进行周期性的 top-k 选择,这不受聚合在激活分布中引起的变化的影响,并且每个更新周期而不是每个词元运行一次选择,从而保持了加速。其次,根据对重要神经元在长推理生成过程中定期重新激活的观察,我们引入了一种激活记忆,可以在更新阶段累积重要性,以便保留重复出现的神经元。在不同推理基准上的实验表明,我们的方法在 DeepSeek-R1-Distill-Qwen-7B 上,在批量大小为 4、目标稀疏度为 50% 的情况下,比之前最先进的自适应剪枝方法的平均准确度提高了 39.7 个百分点,并且在实际稀疏度为 50% 的情况下,比密集推理实现了 1.40 倍的加速。