论文

通过适配器唤醒编码器:语音 LLM 的有效域自适应微调

Encoder Awakening via Adapters: Effective Domain-Adaptive Fine-tuning of Speech-LLMs

模型训练参数高效训练

摘要

语音大型语言模型 (Speech-LLM) 通常由预先训练的语音编码器、模态投影仪和使用低秩适配器 (LoRA) 微调的 LLM 构建而成,在通用域语音上显示出强大的自动语音识别 (ASR) 性能。然而,在有限的目标域数据下,使它们适应域转移语音(例如儿童语音或方言语音)仍然具有挑战性。鉴于 LLM 在语音 LLM 中的主导作用,仅在 LLM 输出处应用交叉熵损失,语音编码器可能无法充分适应新的声学条件。在本文中,我们提出了通过适配器进行编码器唤醒(EAVA),这是一种简单而有效的基于 Speech-LLM 的 ASR 的域自适应微调方法。首先,将轻量级适配器插入每个编码器层并进行专门训练,使目标域声学知识能够合并到编码器中,同时保留其预先训练的知识。其次,将整个模型与应用于 LLM 的 LoRA 一起在目标领域进行联合微调。对三个涵盖儿童和方言语音的域转移 ASR 数据集的实验表明,EAVA 始终优于普通微调和其他基线,实现了新的最先进性能。