论文
Voxtral Realtime
摘要
我们推出 Voxtral Realtime,一个原生流式自动语音识别(Automatic Speech Recognition,ASR)模型,能在亚秒级延迟下达到离线转录的质量。与通过分块或滑动窗口改造离线模型的方法不同,Voxtral Realtime 是针对流式端到端训练的,在音频流与文本流之间具有显式对齐。我们的架构构建于延迟流建模(Delayed Streams Modeling)框架之上,引入了新的因果音频编码器和 Ada RMS-Norm,以改进延迟条件化。我们将预训练扩展到覆盖 13 种语言的大规模数据集。在 480ms 的延迟下,Voxtral Realtime 取得与部署最广泛的离线转录系统 Whisper 相当的性能。我们以 Apache 2.0 许可证发布模型权重。
