论文

ParaASR:基于 LLM 的快速、长上下文语音识别的多标记预测

ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition

模型推理投机采样

摘要

音频编码器-LLM-解码器架构已成为现代自动语音识别 (ASR) 的主导范例,通过大规模语言建模提高转录质量。然而,自回归解码的成本随着解码器的大小而变化,从而在识别质量和服务延迟之间建立了基本的权衡。我们认为这种权衡并不是固有的:与开放式文本生成不同,ASR 输出强烈锚定于输入语音信号,从而为高并行性解码提供了自然的归纳偏差。在此基础上,我们引入了 ParaASR,这是一种 ASR 系统,它利用多词元预测 (MTP) 让 4B LLM 解码器在每个前向步骤发出多个词元。该模型从公开可用的音频语言基础开始,首先建立一个强大的自回归识别器,然后通过分阶段优化配方对齐五个未来词元分支。在推理时,它提出每步有六个词元的延续,并且只允许经过验证的前缀进入转录本,从而保留了标准自回归解码的安全性。 6 个提议词元中的平均接受长度达到 5.0,这证实了语音的确定性结构使 ASR 成为多词元解码的特别自然的设置。 ParaASR 进一步保留了原生 32K 上下文窗口,并一次转录长达 30 分钟的音频。在不同的基准测试中,中文、英文和长篇评估的平均错误率分别为 2.97%、3.68% 和 3.70%,同时实时因子 (RTF) 低至 0.0053。这些结果表明,当未来词元提案由声学信号锚定并由自回归验证保护时,解码器缩放、低延迟推理和长上下文转录不一定是相互竞争的目标。