论文

Voxtral TTS

模型架构混合架构

摘要

我们提出Voxtral TTS,一个富有表现力的多语言文本转语音模型,仅需3秒参考音频即可生成自然语音。Voxtral TTS采用混合架构,将语义语音词元的自回归生成与声学词元的流匹配(flow-matching)相结合。这些词元由Voxtral Codec进行编码和解码,这是一个从零开始训练、采用VQ-FSQ混合量化方案的语音分词器。在由母语者进行的人类评估中,Voxtral TTS凭借自然度和表现力在多语言语音克隆中更受青睐,相对ElevenLabs Flash v2.5取得68.4%的胜率。我们以CC BY-NC许可发布模型权重。

Voxtral TTS:论文配图
图 2:Voxtral TTS 的架构概述。范围从 3 秒到 30 秒的语音参考被馈送到 Voxtral Codec 编码器,以获取帧速率为 12.5 Hz 的音频令牌。每个音频帧(标记为 A)由语义标记和声学标记组成。语音参考音频标记与文本提示标记(标记为 T)一起被馈送到解码器骨干网。解码器自动生成一系列语义标记,直到到达特殊的音频结束标记 (<EOA>)。在每个时间步,来自解码器主干的语义标记被馈送到流匹配转换器,该转换器运行多次以预测声学标记。语义和声学标记被馈送到 Voxtral Codec 解码器以获得生成的波形。