论文
SparseDecoding:解码感知剪枝以实现准确高效的 LLM 推理
SparseDecoding: Decoding-Aware Pruning for Accurate and Efficient LLM Inference
摘要
大型语言模型 (LLM) 推理的解码阶段的内存限制性质会导致显着的延迟。 Hessian 引导的逐层免训练网络剪枝方法已成为解决此问题的重要方法,因为剪枝减少了解码期间从内存读取的非零参数的数量。然而,这一行中的典型方法使用预先收集的自然序列来计算 Hessian,而模型在解码期间被馈送自生成的标记,从而在两个序列之间产生分布偏移。在自然序列上计算的 Hessian 矩阵与在生成序列上计算的 Hessian 矩阵不同。我们观察到这种差异导致生成过程中的激活分布偏离用于修剪的分布,进一步损害了修剪后的模型性能。此外,大多数现有的带来实际加速的LLM修剪方法主要针对稀疏矩阵-矩阵(SpMM)乘法,为主导解码的稀疏矩阵-向量(SpMV)运算提供有限的支持。为了解决这些问题,我们引入 SparseDecoding,一个有原则的解码感知修剪框架,专为准确高效的 LLM 解码而定制。具体来说,在算法轴上,SparseDecoding 根据密集模型自回归生成过程中收集的分层激活(不包括预填充)构建校准矩阵,从而将剪枝目标与解码激活对齐。在系统轴上,我们开发了一个优化的 N:M 稀疏矩阵向量内核,具有位掩码索引和固定步长遍历。代表性 LLM(Llama-3.1-8B、Llama-3.3-70B、Qwen3-14B / 32B)的大量实证结果表明,我们的方法在长格式生成基准上始终优于标准固定文本校准,同时在 A100 GPU 上实现高达 1.48 倍的端到端挂钟解码加速。