论文
使用适度非结构化稀疏权重矩阵加速 大语言模型 的 GPU 推理
Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices
摘要
随着大语言模型(LLM)部署的不断增长,LLM的推理成本已成为一个关键挑战。将稀疏性引入权重矩阵的修剪技术可以加速推理。然而,保持模型质量通常会将修剪限制为中等程度的非结构化稀疏性(大约 50\%)。在这些稀疏级别上,现有的稀疏矩阵乘法 (SpMM) GPU 内核都无法胜过其密集对应内核。本文提出了一种针对 LLM 的高效 GPU 推理方法,具有适度的稀疏性。我们提出了一种三层矩阵存储格式,包括:(i)Sparse-TC 层,使稀疏张量核心能够加速 SpMM; (ii) 时隙填充层,使用并行差分距离进行矩阵压缩,同时支持低成本片上解码; (iii) 轻量级残差层确保正确的 SpMM 计算。基于这种格式,我们设计了一个联合利用稀疏张量核心和 CUDA 核心的 SpMM 内核。这种设计实现了高效的执行管道,并将片上计算与内存访问重叠。评估表明,我们的工作是第一个在配备高带宽内存 (HBM) 的现代 GPU 上超越密集矩阵乘法的工作。与 SpInfer(EuroSys'25,最佳论文)相比,它实现了高达 1.64 倍的内核级加速,并且比 FlashLLM(VLDB'24)实现了高达 1.41 倍的端到端加速。我们的源代码:https://github.com/moui0/cudac。