论文
FlashSVD v1.5:使低秩 Transformer 推理真正快速
FlashSVD v1.5: Making Low-Rank Transformers Inference Actually Fast
摘要
基于 SVD 的低秩压缩减少了 Transformer 参数和标称 FLOP,但这些节省通常很难转化为真正的 LLM 服务加速。我们表明,这种差距很大程度上是一个运行时问题:分解检查点片段执行路径,并且预填充和自回归解码之间产生的开销有很大差异。我们推出了 FlashSVD v1.5,这是一个统一的推理运行时,用于服务 SVD 压缩的 Transformer。 FlashSVD v1.5 将不同的公共 SVD 压缩系列映射到通用分解表示,并将特定于阶段的内核与密集 KV 解码、打包 MLP 执行和每层 CUDA 图形重播相结合,以将低秩服务路径重新组织为精简运行时。在代表性的解码器服务设置中,FlashSVD v1.5 实现了高达 2.55 倍的解码和 2.39 倍的端到端加速,并且在多个流行的 SVD 压缩系列中实现了 1.48 倍的平均解码和 1.44 倍的平均端到端加速。这些结果表明,实际的低秩加速需要运行时协同设计,而不是单独的压缩算法。我们的代码位于:https://github.com/Zishan-Shao/FlashSVD。