论文

MELD:基于梅尔谱图的离散潜变量语音语言建模

MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables

模型训练预训练

摘要

最近的语音语言模型依赖于与自回归模型分开优化的编码器。由于这些编码器不知道下游目标,因此提取的表示对于下游任务可能不是最佳的。为了解决这个限制,我们在梅尔谱图上引入了离散潜变量模型,联合优化编码器和语音语言模型。联合优化不仅在零样本文本转语音(TTS)和语音转文本(STT)任务上改进了基于编解码器和其他基于梅尔谱图的基线,而且还有效缓解了自回归梅尔谱图建模中的常见问题,例如长时间的静音生成和单词遗漏。