论文
基于 LLM 的 TTS 中的动态韵律预测可提高说话者相似度
Dynamic Prosody Prediction in LLM-based TTS for Improving Speaker Similarity
摘要
个性化文本转语音(TTS)旨在在合成语音中克隆目标说话者,模仿声音和说话风格。当前基于 大语言模型 (LLM) 的 TTS 方法忽略了生成语音中特定于风格的韵律模式,导致风格学习不足,从而限制了合成语音中说话者的相似性。为此,我们研究了以合成语音为条件的韵律学习,并提出根据先前预测的语音来预测当前音节的韵律。在三个数据集上获得的实验结果证明了所提出的动态韵律预测方法在增强韵律学习能力方面的功效,从而提高了生成语音的说话人相似度。音频样本可在 https://muzw.github.io/dynapros/ 获取。