论文
神经文本转语音的自蒸馏发音和重音控制
Self-Distilled Pronunciation and Accent Control for Neural Text-to-Speech
摘要
读取原始文本的文本转语音没有词典:罕见的单词会被猜测出来。补救措施是根据录制的语音训练阅读和口音通道,或者一次编辑一个示例中的单词。我们两者都不做。冻结的主干阅读一个包含它已经正确说出的常用单词的句子,然后它自己的输出充当同一个句子的老师,并用带标签的重音阅读替换该单词;这对训练就是整个想法。在 Sarashina2.2-TTS 上,Fleiss kappa = 0.85 的筛选评分者听到 0.89 未见过的单词的指定重音,而 0.57 的假名则无法表达;假名没有赢得任何对;自然性并没有受到明显的伤害。未调整到自回归、扩散和编码器-解码器主干,它传输阅读,0.25 到 0.47 以上,对 319 个单词没有编辑,并且在 CosyVoice 2 上重音在三个单词中的两个单词上,但在 Irodori 上则不然;本文找出了原因。