论文

先剪枝后量化还是先量化后剪枝?理解联合模型压缩中压缩顺序的影响

Prune-then-Quantize or Quantize-then-Prune? Understanding the Impact of Compression Order in Joint Model Compression

模型优化模型压缩

摘要

当多种压缩方法组合使用时会发生什么——应用顺序是否重要?联合模型压缩通过组合剪枝与量化等多种方法以获得更高效率,已成为一种强大策略。联合模型压缩中一个核心但研究不足的因素是压缩顺序,即压缩流水线中不同方法的先后次序。多数先前研究要么以假设各技术相互正交来回避该问题,少数研究则仅在高度受限的情形下加以考察。因此,压缩顺序在塑造模型性能方面更广泛的作用仍知之甚少。本文处理这一被忽视的压缩顺序问题,并提供理论与实证分析。我们将压缩顺序优化问题形式化,并提出渐进强度假设(Progressive Intensity Hypothesis),即较弱的扰动应先于较强的扰动。我们给出理论保证,表明某一顺序的相对收益随底层性能差距增大而增加。在语言与视觉模型上的大量实验验证了该假设,并进一步表明其对多阶段压缩与混合精度量化等更广泛设置的普适性。

先剪枝后量化还是先量化后剪枝?理解联合模型压缩中压缩顺序的影响:论文配图
图 1:渐进强度假设:给定两种压缩技术,我们推测,如果在较弱的方法之后应用较强的方法,则压缩模型的性能会更好。也就是说,修剪和量化之间的最佳顺序随压缩比的变化而变化。