论文
EPTS:用于高效 大语言模型 压缩的弹性 后训练 稀疏性
EPTS: Elastic Post-Training Sparsity for Efficient Large Language Model Compression
摘要
后训练 稀疏性 (PTS) 已成为压缩 大语言模型 的重要范例,以促进在资源受限设备上的高效部署。然而,现有的 PTS 方法通常仅限于单稀疏性优化,需要针对每个特定的稀疏性级别进行单独的、耗时的优化会话。这种僵化的范式极大地阻碍了跨不同硬件场景的灵活部署,因为适应新的稀疏性要求需要完整的重新优化过程。为了解决这些限制,我们提出了 Elastic 后训练 Sparsity (EPTS),这是一种统一的多重稀疏框架,可生成单个弹性模型,能够通过一次性优化过程在不同的稀疏配置中保持稳健的性能。具体来说,我们设计了一种多稀疏层次LoRA(MS-HiLoRA)机制,促进从低稀疏度到高稀疏度组的知识继承,有效减轻参数重建的竞争。此外,我们引入了多稀疏特征混合器(MSFM),它通过动态融合不同稀疏粒度的特征表示,显着增强了模型对修剪扰动的适应性。对 LLaMA 和 OPT 系列的大量实验表明,与 SparseGPT 和 Wanda 等最先进的方法相比,EPTS 实现了具有竞争力的性能,同时通过单一优化实现多场景部署,从而显着提高了效率。我们的源代码可在 https://github.com/xuke225/EPTS 获取。