论文

超越失败:在以 GEMM 为中心的分类法下对 LLM 修剪的真实推理加速进行基准测试

Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy

模型评测基准与评测资源

摘要

剪枝已成为加速 大语言模型 (LLM) 推理的主导范例,涵盖了消除跨标记、层、头、维度和注意力模式计算的广泛方法。尽管共享相同的目标,但这些修剪方法会导致根本不同的执行行为,导致实现的加速严重依赖于硬件和内核实现。因此,不同修剪家族的实际加速效益仍然知之甚少。在这项工作中,我们引入了一种以 GEMM 为中心的分类法,该分类法根据通用矩阵乘法(GEMM)的逻辑 \textbf{M}、\textbf{N} 和 \textbf{K} 维度重新组织现有的修剪方法。利用这种抽象,我们构建了一个统一的基准测试框架,可以在整个修剪设计空间中进行实现一致的比较,并系统地表征加速质量帕累托前沿。我们在 Llama3.1-8B 上的结果表明,静态深度剪枝仍然是最强的帕累托最优基线,并且在内存有限的情况下最接近其理论加速上限。在预填充期间,前沿从低质量损失(0\%--4\%)下的静态深度过渡到中等损失(5\%--16\%)下的动态深度,最后过渡到较高损失水平(17\%--26\%)下的静态宽度修剪。这些发现建立了基于剪枝的 LLM 加速的实际限制的第一个统一视图,并为未来的剪枝研究提供了指导。代码可在 https://github.com/EIT-NLP/LLM-Pruning/tree/main/PruningInferSim 获取