论文

EmoTra-TTS:用于语音合成的平滑的话语内情感转换

EmoTra-TTS: Smooth Intra-Utterance Emotion Transitions for Speech Synthesis

应用与实践内容创作

摘要

关于情绪动态的心理学研究已经证实,人类的情感是一个持续不断发展的过程:情绪在几秒钟内上升、衰减和转变。然而,当前的情感文本转语音 (TTS) 系统以单个离散标签或每个话语的静态嵌入为条件,从根本上与情感的时间性质不一致。虽然最近基于 LLM 的 TTS 系统可能会通过文本理解隐式改变韵律,但这种变化对于目标话语内转换来说既不是明确可控的,也不够精确。我们解决了三个挑战:(1)多通道流混合管道合成帧对齐的过渡音频,避免自然话语内过渡的稀缺性; (2) 双阶段效价-唤醒-支配 (VAD) 调节通过帧级 VAD 嵌入指导 LLM 中的韵律规划和流解码器中的声学实现; (3)方向-幅度解耦注入在结构上将情感方向与注入幅度分开,防止内容降级。 EmoTra-TTS 仅添加 +0.43% 的参数,没有延迟开销,在情绪转换质量上实现了 30%-87% 的相对改进,在针对四个 SOTA 基线和两个商业系统的成对偏好测试​​中,整体获胜率为 64.4%-79.5%,证实了这一点。