论文
MimicLM:通过伪并行语音语料库的自回归建模进行零样本语音模仿
MimicLM: Zero-Shot Voice Imitation through Autoregressive Modeling of Pseudo-Parallel Speech Corpora
摘要
语音模仿旨在转换源语音以匹配参考说话者的音色和说话风格,同时保留语言内容。一种直接的方法是对(源、参考、目标)三元组进行训练,其中源和目标共享相同的内容,但目标与参考的语音特征匹配,但此类数据极其稀缺。现有方法要么采用精心设计的解缠结架构来绕过这种数据稀缺性,要么利用外部系统来合成伪并行训练数据。然而,前者需要复杂的模型设计,后者在使用合成语音作为训练目标时面临质量天花板。为了解决这些限制,我们提出了 MimicLM,它采用一种新颖的方法,使用合成语音作为训练源,同时保留真实录音作为目标。这种设计使模型能够直接从真实的语音分布中学习,打破了合成质量的上限。在此数据构建方法的基础上,我们采用交错文本音频建模来指导生成内容准确的语音,并应用具有偏好对齐的 后训练 来减轻合成数据训练时固有的分布不匹配。实验表明,MimicLM 通过简单而有效的架构实现了卓越的语音模仿质量,在自然度方面显着优于现有方法,同时在说话者身份、口音和情感维度上保持有竞争力的相似度分数。