论文
通过表示层次结构揭开修剪工作的神秘面纱
Demystifying When Pruning Works via Representation Hierarchies
摘要
网络修剪会删除不太重要的参数或架构,通常有望在保持性能的同时提高效率。然而,这种期望在语言任务中并不总是成立:修剪后的模型可以在非生成任务上表现良好,但在生成环境中经常失败。为了理解这种差异,我们从表示层次结构的角度分析网络剪枝,将语言模型的内部计算分解为三个连续空间:嵌入(隐藏表示)、logits(softmax 前输出)和概率(softmax 后分布)。我们发现嵌入和 logits 空间中的表示对于修剪引起的扰动在很大程度上具有鲁棒性。然而,从 logits 到概率的非线性变换放大了这些偏差,这些偏差在时间步长上累积并导致生成过程中的大幅退化。相反,分类标记概率子空间的稳定性以及嵌入空间的鲁棒性支持了对非生成任务(例如检索和多项选择选择)进行修剪的有效性。我们的分析阐明了跨任务修剪的影响,并为其应用提供了实用指导。代码可在 https://github.com/CASE-Lab-UMD/Pruning-on-Representations 获取