论文

基于LLM的流 ASR 的分解延迟流建模

Factorized Delayed Streams Modeling for LLM-based Streaming ASR

应用与实践语音识别与转写

摘要

延迟流建模 (DSM) 通过在公共时间线上对齐声学和文本流来实现基于LLM的流式自动语音识别 (ASR)。 DSM 将填充token <p> 和词开头token <w> 添加到LLM词汇表中,并使用相同的 softmax 将它们与普通文本token一起预测。我们首先证明可以在保持有竞争力的识别性能的同时删除 <w>。基于这个结果,我们提出了因式分解 DSM (F-DSM),它将 <p> 的等待概率与原始LLM词汇表的分布分开。此分解从文本预测空间中删除了 ASR 特定的token,并允许在等待步骤中跳过大词汇量的 softmax。在Spontaneous Japanese的语料库和LibriSpeech上的实验表明,F-DSM比DSM取得了更好的识别性能。它还大大减少了 GPU 记忆的使用,同时保持类似的训练吞吐量,通过 softmax 跳过提供了小幅推理速度改进,并减少了 DSM 观察到的纯文本困惑度的下降。

基于LLM的流 ASR 的分解延迟流建模的原论文方法或结果图
图 1:DSM(左)联合预测等待 <p>、单词开头 <w> 和文本token; F-DSM(右)将原始LLM词汇表上的等待与文本预测分开。