论文
Swift-SVD:理论最优性满足低秩 LLM 压缩的实际效率
Swift-SVD: Theoretical Optimality Meets Practical Efficiency in Low-Rank LLM Compression
摘要
大语言模型的部署受到静态权重和动态Key-Value缓存的内存和带宽需求的限制。基于 SVD 的压缩提供了一种硬件友好的解决方案来降低这些成本。然而,现有方法存在两个关键限制:一些方法在重建误差方面不是最优的,而另一些方法在理论上是最优的,但实际上效率低下。在本文中,我们提出了 Swift-SVD,一种激活感知的封闭式压缩框架,可同时保证理论最优、实际效率和数值稳定性。 Swift-SVD 增量聚合给定一批输入的输出激活的协方差,并在聚合后执行单个特征值分解,从而实现 无需训练、快速且最优的逐层低秩逼近。我们采用有效秩来分析局部分层压缩性,并设计一种动态秩分配策略,共同考虑局部重建损失和端到端层重要性。跨越 6 个 LLM 和 8 个数据集的大量实验表明,Swift-SVD 的性能优于最先进的基线,实现了最佳压缩精度,同时在端到端压缩时间中提供 3-70 倍的加速。我们的代码可在 https://github.com/hiahei/Swift-SVD 获取。