论文
RT-Lynx:将 GEMM 稀疏性放在扩散模型的正确位置
RT-Lynx: Putting GEMM Sparsity in the Right Place for Diffusion Models
摘要
Diffusion Transformer (DiT) 在图像生成方面实现了强大的性能,但会产生大量的推理成本。虽然之前的工作通过量化和 蒸馏 降低了这种成本,但可以将 FLOP 几乎减半的半结构化稀疏性仍然没有得到充分探索。一个关键原因是大多数现有方法都专注于权重稀疏化,修剪 50% 的权重可能会消除关键模型容量并降低生成质量。然而,我们的研究表明,DiT 激活本质上是稀疏的,并且对于 N:M 半结构化稀疏化来说比权重更加稳健。受这一观察的启发,我们提倡从权重稀疏化到激活稀疏化的范式转变。我们提出了 RT-Lynx,它将 N:M 稀疏化应用于激活并结合误差补偿技术来减轻准确性损失。我们进一步实现了针对此设置量身定制的高度优化的 CUDA 内核,在线性层中实现了平均 1.55 倍的加速。跨多个扩散模型的大量实验表明,我们的方法保留了原始模型的生成质量,同时大大加速了推理。