论文
可微分位宽:通过 SVD 共同优化修剪和量化,实现超高效LLM压缩
Differentiable Bit-Widths: Co-optimizing Pruning and Quantization via SVD for Ultra-Efficient LLM Compression
摘要
基于 SVD 的修剪和量化最近已成为大语言模型超高效压缩的一种有前景的策略。在这些方法中,压缩分两个阶段执行:首先截断分量,然后对剩余分量进行量化。尽管这种解耦管道受益于修剪和量化,但它需要对每个阶段进行单独优化,并且无法充分利用它们的平衡,这可能导致在激进压缩下性能不佳。为了解决这个限制,我们提出了一种新的LLM压缩方法,该方法在统一框架中共同优化修剪和量化。我们的关键思想是一种可微分的方法,用于学习逐个组件的位宽,允许为不太重要的组件分配 0 位精度并剪掉。值得注意的是,即使受到专为超高效率而设计的极端量化设置($1.61$ 位),我们的方法也能在两阶段基线上表现良好。代码:https://github.com/MMAI-Laboratory/DBW.