论文

Voxtral Realtime

模型架构Transformer

摘要

我们推出 Voxtral Realtime,一个原生流式自动语音识别(Automatic Speech Recognition,ASR)模型,能在亚秒级延迟下达到离线转录的质量。与通过分块或滑动窗口改造离线模型的方法不同,Voxtral Realtime 是针对流式端到端训练的,在音频流与文本流之间具有显式对齐。我们的架构构建于延迟流建模(Delayed Streams Modeling)框架之上,引入了新的因果音频编码器和 Ada RMS-Norm,以改进延迟条件化。我们将预训练扩展到覆盖 13 种语言的大规模数据集。在 480ms 的延迟下,Voxtral Realtime 取得与部署最广泛的离线转录系统 Whisper 相当的性能。我们以 Apache 2.0 许可证发布模型权重。

Voxtral Realtime
图2:目标延迟 τ = 80 \tau=80 ms 下 Voxtral Realtime 的架构与解码方案。Voxtral Realtime 由一个用于嵌入输入音频流的因果音频编码器、一个用于对音频嵌入做时间下采样的 MLP 适配层,以及一个以自回归方式生成输出文本流的文本解码器组成。来自适配层的下采样音频嵌入与已生成 token 的嵌入具有相同的 12.5Hz 帧率,每一帧代表 80ms 的音频。二者相加后由文本解码器处理,解码器每帧预测一个 token。在等待足够声学证据期间,解码器输出填充 token [P]。一旦某个词在声学上完整且目标延迟 τ \tau 已过,就输出词边界 token [W] 以启动生成,随后输出相应的子词 token。