论文

面向LLM压缩的联合结构剪枝与混合精度量化

Joint Structural Pruning and Mixed-Precision Quantization for LLM Compression

模型优化模型压缩

摘要

最近,大型语言模型(LLM)部署的效率已成为实际应用中的关键问题。虽然训练后量化 (PTQ) 和结构剪枝是减少内存占用和推理延迟的既定技术,但大多数现有 PTQ 方法在每层的基础上优化量化误差,忽略了误差如何在网络中累积和传播,通常会导致解决方案次优。传统的管道还倾向于单独或顺序地应用剪枝和量化,从而进一步加剧次优性。我们引入了一种新颖的端到端框架,它以两种关键方式解决了这些限制。首先,我们提出了一种新颖的混合精度 PTQ 策略,该策略直接最小化整个模型中的全局误差传播,而不是隔离逐层误差。在此基础上,我们开发了一种新颖的联合优化方法,该方法可以在统一的搜索空间内同时学习结构修剪决策和混合精度量化策略。大量实验表明,在超低精度(1-3 位)下,与最先进的 (SoTA) 权重激活量化基线相比,我们的量化方法可将 WikiText 的困惑度降低高达 21%。与领先的仅权重量化方法相比,它在 WikiText 和 C4 上的困惑度分别降低了 59% 和 85%。与 SoTA 联合剪枝和量化技术相比,我们提出的方法在超低位下提供了卓越的困惑度和推理性能。

面向LLM压缩的联合结构剪枝与混合精度量化:论文配图
图 1:TOGA 中屏蔽的可压缩超网概述。灰色模块被冻结。否则,彩色模块是可训练的。