论文

JoyAI-Voice 2.0:语义与声学联合表征的连续自回归语音生成

JoyAI-Voice 2.0: A Full-Continuous Autoregressive Speech Generation Model with Semantic-Acoustic Joint Representation

模型架构模型训练应用与实践混合架构强化学习语音交互与综合语音服务

摘要

我们推出了 JoyAI-Voice~2.0,这是一种基于完全连续的双编码器架构构建的端到端拟人语音生成模型。原始语音被编码成连续的潜在变量并分割成补丁。每个补丁都由语义-声学双编码器分解为语义纯化表示和声学表示,它们被融合并联合馈送到因果自回归 Transformer 进行规划。 Transformer 预测下一个补丁的调节,局部扩散 Transformer 渲染其 48kHz 合成的全部潜力。该模型采用联合流匹配和停止预测目标进行训练,然后使用 DiffusionNFT 进行监督微调和强化学习,以提高模型性能。它在 Seed-TTS 上实现了 2.51% 的最低平均单词错误率,比最强基线相对减少了 14.9%,在 InstructTTSEval 上的中英文属性保真度达到了最先进的水平,在 10 个感知维度中的 5 个维度上领先,在 MDVD-Eval 上的总分最高为 0.893。

JoyAI-Voice 2.0:语义与声学联合表征的连续自回归语音生成:论文原图
图3:JoyAI-Voice 2.0架构。原始波形由 AudioVAE 压缩为连续的潜在波形,并划分为补丁。每个补丁都由双编码器分解为语义纯化的表示和声学表示,它们被融合并联合馈送到因果自回归 Transformer 进行规划。局部扩散 Transformer 渲染下一个 patch 的潜在信号,并将其解码为 48 kHz 波形。