论文
SpenseGPT:实用的一次性剪枝,为 LLM 推理启用稀疏和密集 GEMM
SpenseGPT: Practical One-shot Pruning Enabling Sparse and Dense GEMMs for LLM Inference
摘要
现代加速器广泛支持半结构化 2:4 稀疏性,可提供高达 2 倍的理论加速。然而,其严格的 50% 稀疏度约束在 后训练 剪枝下通常会导致不可忽略的精度下降。同时,现有的宽松稀疏格式要么需要专门的编译器支持,要么引入限制端到端加速的运行时开销。我们提出了 Spense,一种实用的混合稀疏-密集格式,它将每个权重矩阵分为 2:4 稀疏区域和密集区域。这种设计放松了有效的稀疏性约束,同时保持与现有高性能稀疏和密集 GEMM 库的兼容性,避免了自定义编译器支持和输入激活扩展。在此格式的基础上,我们引入了 SpenseGPT,这是一种一次性 后训练 修剪方法,可产生稀疏和密集区域。值得注意的是,我们表明选择正确的密集区域很重要,并且我们设计了两种不同的策略来选择它们。 Qwen3-32B 和 Seed-OSS-36B 上的实验表明,我们的方法在具有 FP8 精度的 B200 GPU 上实现了高达 1.2 倍的端到端解码加速,同时保持了准确性。据我们所知,这是首次在 B200 等最新 GPU 上通过半结构化稀疏张量核心实现真实世界端到端 LLM 解码加速的一次性剪枝演示,同时保持模型质量。