论文

Mega-ASR:通过扩大现实世界声学模拟实现野外^2语音识别

Mega-ASR: Towards In-the-wild^2 Speech Recognition via Scaling up Real-world Acoustic Simulation

模型训练合成数据

摘要

尽管自动语音识别(ASR)和大型音频语言模型取得了快速进步,但现实环境中的鲁棒识别仍然受到“声学鲁棒性瓶颈”的限制:模型经常失去声学基础,并在严重的成分失真下产生遗漏或幻觉。我们提出了 Mega-ASR,这是一种统一的野外 ASR 框架,它将可扩展的复合数据构造与渐进式声学到语义优化相结合。我们引入了 Voices-in-the-Wild-2M,涵盖 7 种经典声学现象和 54 种物理上合理的复合场景,并使用声学到语义渐进监督 微调 和双粒度 WER 门控策略优化来训练 Mega-ASR。大量实验表明,Mega-ASR 在不利条件 ASR 基准测试中比之前最先进的系统具有显着优势(VOiCES R4-B-F 上为 45.69% vs. 54.01%,NOIZEUS Sta-0 上为 21.49% vs. 29.34%)。在复杂的合成声学场景中,与强大的开源和闭源基线相比,Mega-ASR 进一步实现了超过 30% 的相对 WER 降低,为野外稳健的 ASR 建立了可扩展的范例。