论文
Voxtral TTS
摘要
我们提出Voxtral TTS,一个富有表现力的多语言文本转语音模型,仅需3秒参考音频即可生成自然语音。Voxtral TTS采用混合架构,将语义语音词元的自回归生成与声学词元的流匹配(flow-matching)相结合。这些词元由Voxtral Codec进行编码和解码,这是一个从零开始训练、采用VQ-FSQ混合量化方案的语音分词器。在由母语者进行的人类评估中,Voxtral TTS凭借自然度和表现力在多语言语音克隆中更受青睐,相对ElevenLabs Flash v2.5取得68.4%的胜率。我们以CC BY-NC许可发布模型权重。
