论文
通过多模态深度放大使文本 LLM 适应语音
Adapting Text LLMs to Speech via Multimodal Depth Up-Scaling
摘要
通过对语音数据进行持续预训练,将预训练文本 大语言模型 (LLM) 适应语音语言模型 (Speech LM) 是有前景的,但通常会降低原始文本的能力。我们提出了多模态深度升级,这是连续 LLM 预训练 中新兴策略的扩展,其中新的 Transformer 层被插入到冻结文本 LLM 中,并且仅添加的层在语音数据上进行训练。使用 SmolLM2-360M 和 SmolLM2-1.7B 在 48k 小时的英语自动语音识别 (ASR) 数据上进行的实验表明,深度放大实现的 ASR 与完整的 微调 相当,同时导致的文本降级远少于完整的 微调 和低秩适应 (LoRA)。我们进一步表明,结合 E-Branchformer(一种专为语音识别而设计的架构),插入层可实现与较大模型上的完整 微调 相匹配或超过的 ASR,同时将文本质量降低超过 75%,可训练参数减少 60%。