论文
EmoRES-TTS:用于情感语音生成的剩余增强矢量控制
EmoRES-TTS: Residual-Enhanced Vector Steering for Emotional Speech Generation
摘要
情绪调节的文本转语音 (TTS) 模型可能无法可靠地表达所请求的情绪,并且通过额外训练来提高可控性在计算和情绪标记的语音训练数据中成本高昂。因此,我们研究矢量控制,这是一种无需训练的方法,可以修改冻结模型的内部表示。 CoCoEmo 是一种用于情感 TTS 的传统矢量控制方法,将每个情感矢量视为由单一全局强度控制的不可分割的方向,限制了对所请求情感的遵守。在这项工作中,我们首先发现情感向量可以分解为一个共享组件,该组件使语音远离中性表达,以及一个剩余组件,该组件引导生成所请求的情感。基于这一发现,我们提出了 TTS 情感残留增强转向 (EmoRES),这是一种无需重新训练主干网络即可控制两个组件的新颖方法。在 IEMOCAP 上,EmoRES 在 IndexTTS-2 和 CosyVoice2 主干上的所有四个客观情绪指标上都优于 CoCoEmo。排名相关性提升了26.13和12.97个百分点,对应相对增益118.8%和33.1%;情感命中率提升12.95和6.92个百分点,对应相对增益20.1%和9.8%。人类评估进一步显示,听众正确识别主要请求情绪的比率相对提高了 35.0%,保真度提高了 17.3%,而在成对比较中,听众更喜欢 EmoRES 的自然性,高达 63.8%。成分消融进一步表明,有效的控制受益于保留共享成分,同时加强情感引导向量的残差。