论文
语音遇见 ELF:用于语音识别和翻译的音频条件连续目标扩散
Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation
摘要
用于识别 (ASR) 和翻译 (S2TT) 的语音转文本 (S2T) 系统通常会生成离散文本标记。相比之下,连续目标语言建模在连续空间中执行生成,但其 S2T 潜力仍未被开发。为了弥补这一差距,我们提出了 ELF-S2T,一种用于 S2T 的音频调节连续目标生成模型。 ELF-S2T 基于预先训练的嵌入式语言流 (ELF) 主干网络构建,通过冻结的 Whisper 编码器和单个线性投影仪处理语音,将生成的音频条件添加到潜在的噪声文本中,以实现上下文中的流匹配去噪。为了防止模型过度依赖其预先训练的文本上下文,我们在训练期间引入了音频强制,并通过推理时的无分类器指导进一步放大了音频条件。 LibriSpeech 和 CoVoST2 上的实验表明,ELF-S2T 实现了有竞争力的 ASR 和 S2TT 性能。至关重要的是,我们的错误分析表明,尽管 ASR 和 S2TT 错误表面上看起来非常不同,但两者都源于相同的根本原因,即连续潜在空间中的近距离混淆。这一发现自然地与连续表示生成范式一致,表明识别和翻译下存在常见的语义映射过程。我们的代码和预训练模型可在 https://github.com/Sslnon/ELF-S2T 上公开获取。