论文
用于语音识别的扩散语言模型
Diffusion Language Models for Speech Recognition
摘要
由于具有双向注意力和并行文本生成的能力,扩散语言模型最近已成为标准语言模型的主要替代方案。在这项工作中,我们探索了它们在语音识别中的使用变体。具体来说,我们介绍了一个综合指南,用于合并掩码扩散语言模型(MDLM)和均匀状态扩散模型(USDM)来重新评分 ASR 假设。此外,我们设计了一种新的联合解码方法,通过将 CTC 导出的帧概率分布与 USDM 在每个解码步骤计算的标签概率分布相结合,将 CTC 和 USDM 结合起来,从而生成结合了 USDM 的强大语言知识和 CTC 的声学信息的新候选者。我们的研究结果表明,USDM 以及 MDLM 可以显着提高识别文本的准确性。我们发布了所有的代码和食谱。