论文

具有细节链的文本转语音:对语音生成中的时间动态进行建模

Text-To-Speech with Chain-of-Details: modeling temporal dynamics in speech generation

应用与实践内容创作

摘要

文本转语音 (TTS) 合成的最新进展见证了多阶段方法的流行,这些方法首先预测语义标记,然后生成声学标记。在本文中,我们将粗到细的生成范例扩展到时域,并引入了细节链(CoD),这是一种新颖的框架,它使用级联架构对语音生成中从粗到细的时间动态进行显式建模。我们的方法逐步细化多个阶段的时间细节,每个阶段都针对特定的时间粒度。所有时间细节预测均使用共享解码器执行,从而实现跨不同时间分辨率的高效参数利用。值得注意的是,我们观察到最低的细节级别自然地执行语音规划,而不需要显式的音素持续时间预测器。我们在多个数据集上评估我们的方法,并将其与多个基线进行比较。实验结果表明,CoD 使用比现有方法少得多的参数实现了具有竞争力的性能。我们的研究结果表明,使用 CoD 框架对时间动态进行显式建模可以实现更自然的语音合成。