论文
减少六层:通过无标签恢复对 Whisper 进行编码器修剪
Six Layers Less: Encoder Pruning for Whisper with Label-Free Recovery
摘要
修剪基于 Transformer 的大型预训练 ASR 模型(例如 OpenAI 的 Whisper)已得到广泛采用,因为修剪解码器可以显着提高端到端转录速度。例如,{\tt Whisper-large-v3-turbo} 变体将解码器从 32 层减少到 4 层,而 Distill-Whisper 类似地将解码器减少到仅 2 层。尽管人们对减小编码器的尺寸给予了一些关注,但还没有一种方法得到广泛采用。这可能是由于需要自定义推理实现来利用压缩模型。我们提出了一种通过字错误率(WER)的留一层变化对编码器层进行排名的方法。导致变化最小的六层被删除,对应于编码器堆栈的 $18.5\%$。修剪后的模型不需要自定义推理代码,因为它只是一个层数更少的更浅的编码器。我们进一步提炼使用未标记的单语语音数据来恢复由零样本层剪枝引起的性能下降。四种语言的平均 WER 在蒸馏后增加到 $20.1\%$,而零样本的平均 WER 为 $21.9\%$,基线为 $18.2\%$。我们发布了所有代码(此 https URL)和修剪后的模型(此 https URL)。