论文
CtrlSpeech:从粗到细控制富有表现力的语音合成
CtrlSpeech: Coarse-to-Fine Control for Expressive Speech Synthesis
摘要
最近的文本转语音(TTS)系统已经实现了很强的自然度和零样本语音克隆性能,但在单词或音素级别的表达性语音的细粒度控制仍然具有挑战性。我们提出了 CtrlSpeech,一个可控的、富有表现力的 TTS 框架,具有从粗到细的控制。 CtrlSpeech 基于 DiTAR 架构构建,将全局说话人调节与手机对齐的音高、响度和持续时间信号相结合,实现本地化韵律控制,同时保留目标说话人的音色。这种设计允许用户在精细的时间粒度上调整表达属性,使语音细化更加灵活可控。实验结果表明,CtrlSpeech 实现了有竞争力的零样本 TTS 性能,并提高了表达属性的可控性,证明了其灵活实用的表达语音合成的有效性。