论文

从非流式语音语言模型蒸馏对齐路径,支持流式语音识别

Alignment-Path Distillation from Non-streaming ASR-LLMs for Streaming Speech Recognition

摘要

在本文中,我们提出了一种用于具有大型语言模型(LLM)的流式自动语音识别(ASR)的对齐路径蒸馏框架。交错流式 ASR-LLM 使用对齐模型中的强制对齐 (FA)(例如使用联结时间分类 (CTC) 训练的模型)来构建语音文本训练序列。然而,从单独的声学模型获得的对齐可能与基于 LLM 的 ASR 学到的对齐不一致。这促使我们从非流式 ASR-LLM 传输对齐信息以改进流式识别。具体来说,我们从非流媒体教师的软文本音频注意力中提取单调对齐路径,并使用它们来构建交错训练序列。该框架还包括logits与隐藏状态蒸馏,以从教师的输出分布和内部表示中学习。实验结果表明,在没有 logit 或隐藏状态蒸馏的情况下,与使用强制对齐的训练相比,使用教师导出的对齐路径进行训练的相对错误率降低了 5.2%。当两个模型都使用 logit 和隐藏状态蒸馏时,教师导出的对齐可以使相对错误率降低 3.9%,平均发射延迟相似,但闪烁更高。与使用没有 Logit 或隐藏状态蒸馏的强制对齐进行训练相比,完整的框架实现了 16.6% 的相对错误率降低。