论文
T5Gemma-TTS:以持续文本条件增强语音合成
T5Gemma-TTS Technical Report
摘要
自回归神经编解码器语言模型具备较强的零样本声音克隆能力,但仅解码器架构把输入文本当作前缀,与逐渐增长的音频序列争用位置容量,长语句的文本条件因而减弱。本文提出T5Gemma-TTS编码器—解码器模型,在每一解码层通过交叉注意力持续接收双向文本表示。模型建立在T5Gemma预训练骨干上,编码器和解码器各2B参数,共4B;无需音素转换,直接处理子词级文本。在全部26个交叉注意力层加入进度监控旋转位置嵌入PM-RoPE,用归一化进度帮助跟踪目标语音长度。模型用17万小时英语、中文和日语语音训练,日语说话人相似度显著优于XTTSv2(0.677对0.622,95%置信区间不重叠)。虽未训练韩语,其韩语相似度数值最高(0.747对XTTSv2的0.741),但差异尚无统计确定性。五种基线比较中,日语字符错误率数值最低(0.126),但与Kokoro的置信区间部分重叠。LibriSpeech英语结果应看作上界估计,因为训练使用的LibriHeavy是其超集。同一检查点在推理时关闭PM-RoPE后,字符错误率从0.129升至0.982、时长准确率从79%降至46%,几乎无法正常合成。代码和权重:https://github.com/Aratako/T5Gemma-TTS。