论文
论编码器深度的作用:SLAM-ASR 中的剪枝 Whisper 和 LoRA 微调
On the Role of Encoder Depth: Pruning Whisper and LoRA Fine-Tuning in SLAM-ASR
摘要
近年来,在大规模预训练模型和 SLAM-ASR 等端到端架构的推动下,自动语音识别 (ASR) 发展迅速。 SLAM-ASR 系统的关键组件是 Whisper 语音编码器,它提供强大的声学表示。虽然模型修剪已经在完整的 Whisper 编码器-解码器架构中进行了探索,但其在 SLAM-ASR 设置中的影响仍未得到充分研究。在这项工作中,我们分析了当 Whisper 编码器用作 SLAM-ASR 的声学主干时层修剪的效果。我们进一步研究了基于 LoRA 的 微调 可以在多大程度上恢复由剪枝引起的性能下降。在三种 Whisper 变体(小、中、大 v2)、代表不同资源级别的三种语言(丹麦语、荷兰语、英语)以及超过 200 次训练运行中进行的实验表明,修剪两个编码器层仅导致 2-4% 的 WER 降级,并且将此修剪与 LoRA 适应相结合始终优于未修剪的基线,同时将总参数减少 7-14%。此外,我们的错误分析表明,LoRA 主要通过语言模型的语言先验进行补偿,将荷兰语和英语的总单词错误减少了 11-21%,其中替换和删除显示出最大的减少量。然而,对于资源匮乏的丹麦语,减少幅度较小(4-7%),并且 LoRA 引入了增加的插入错误,表明补偿有效性取决于 LLM 预先存在的语言熟练程度和可用的训练数据。