论文
音频-图像对齐作为自动语音识别中的持续预训练阶段
Audio--Image Alignment as a Continued-Pretraining Stage in Automatic Speech Recognition
摘要
全球使用数千种语言,但由于高质量转录语音数据的可用性有限,许多语言的自动语音识别 (ASR) 资源仍然不足。收集准确的转录通常成本高昂且劳动密集型,特别是对于资源匮乏的语言而言。在这项工作中,我们在大规模预训练和监督 ASR 微调 之间引入了表示对齐阶段,其中从预训练的视觉编码器中提取的图像表示与音频表示对齐,以仅使用成对的音频图像数据来调整预训练的音频编码器,而无需转录。在 FLEURS 上,对齐将 11 种印度语言的总体 WER 从 66.42% 降低到 49.77%,相对降低了 25.07%,这在每种语言中都具有统计显着性。两个控制确定增益来自图像信号本身:计算匹配的持续预训练基线没有产生任何改进(66.42% vs. 65.99%),而打乱音频图像对则完全消除了好处(72.60%)。对齐的编码器还在 Vaani 和 LibriSpeech 上以每个 微调 预算从 10 到 100 小时的基础上进行了改进,在最低资源设置中获得了最大的增益。这些发现强调音频-图像表示对齐是 ASR 的有效无转录适应策略。