论文

在基于 LLM 的 ASR 中使用有限的音频缩小语音文本差距,实现有效的域适应

Closing the Speech-Text Gap with Limited Audio for Effective Domain Adaptation in LLM-Based ASR

模型训练监督微调与指令调优

摘要

传统的端到端自动语音识别(ASR)系统依赖于成对的语音文本数据来进行域适应。最近基于 LLM 的 ASR 架构通过投影模块将语音编码器连接到 大语言模型,从而能够适应纯文本数据。然而,这引入了模态差距,因为 LLM 不会受到语音投影仪产生的噪声表示的影响。我们研究少量的语音是否可以减轻这种不匹配。我们比较了三种策略:纯文本自适应、语音文本配对自适应以及将两者结合起来的混合批处理 (MB)。域内和域外设置中的实验表明,即使有限的语音也能持续提高性能。值得注意的是,仅使用 10% 的目标域(少于 4 小时)语音的 MB 就实现了与具有完整数据集的传统 ASR 微调 相当或更好的字错误率,这表明少量语音提供了强大的模态对齐信号。