论文
用于流式语音识别的分块对齐器
Chunkwise Aligners for Streaming Speech Recognition
摘要
我们提出了 Chunkwise Aligner,这是一种用于流式自动语音识别 (ASR) 的新颖架构。虽然 Transducer 是流式 ASR 的标准模型,但由于需要计算所有可能的音频标签对齐,因此其训练成本高昂。最近推出的 Aligner 通过丢弃显式对齐来降低此成本,但这种修改使其不适合流式处理。我们的方法通过将音频划分为块并将每个标签与其块的最左边的帧对齐来克服此限制,而块之间的转换由学习的块结束概率来管理。实验表明,Chunkwise Aligner 不仅在离线和流媒体场景下与 Transducer 的精度相匹配,而且还提供卓越的训练和解码效率。