论文

用于非自回归语音识别的 CTC 种子词元编辑细化

CTC-Seeded Token Edit Refinement for Non-Autoregressive Speech Recognition

模型推理解码与生成控制

摘要

非自回归自动语音识别 (ASR) 支持并行解码,但许多基于细化的方法从随机、完全屏蔽或固定长度的标记序列开始,需要多次迭代才能重建完整的转录本。相反,我们将 ASR 解码制定为贪婪联结主义时间分类 (CTC) 假设的可变长度编辑细化。声条件编辑流解码器直接对折叠的 CTC 假设进行操作,并行预测插入、删除和替换操作。编辑流解码器使用连续时间离散扩散损失与 CTC 模型联合训练。在推理过程中,我们发现只需两个编辑步骤即可大幅降低字错误率 (WER),并且无分类器指导 (CFG) 通过将模型聚焦于音频特征来进一步提高识别质量。我们还使用 CTC 置信度来限制编辑提案以提高准确性。最后,消融研究验证了我们的设计选择,而解码器预训练和预训练编码器集成可带来显着的额外性能提升。