论文
用于在基于扩散的 TTS 中建模尖锐韵律动态的自适应振荡感应偏置
Adaptive Oscillatory Inductive Bias for Modeling Sharp Prosodic Dynamics in Diffusion-Based TTS
摘要
基于扩散的文本转语音 (TTS) 模型在语音质量方面取得了显着改进。然而,对表达性语音中尖锐的韵律过渡和快速的音调变化进行建模仍然具有挑战性。现有的基于扩散的 TTS 解码器通常利用周期性非线性(例如 Snake 激活函数)来捕获谐波结构,但该激活函数在对突变幅度和频率变化进行建模时提供的适应性有限。在本文中,我们研究了振荡感应偏置在基于扩散的 TTS 解码器中的作用,并引入了自适应振荡非线性,该非线性可实现可控周期性调制,同时通过线性旁路组件保持信号稳定性。我们将生成的 TTS 系统称为 OscillaTTS。 LJSpeech 和情感语音数据集的实验表明,客观和主观评估都有一致的改进,这表明表达韵律动态的建模得到了改进。