论文

MAGIC-TTS:具有显式局部持续时间和暂停控制的细粒度可控语音合成

MAGIC-TTS: Fine-Grained Controllable Speech Synthesis with Explicit Local Duration and Pause Control

应用与实践内容创作

摘要

现代文本转语音系统仍然缺乏细粒度的本地时序控制:现有方法通常仅提供话语级持续时间或全局语速控制,而精确的 词元级 时序操作仍然不可用。据我们所知,MAGIC-TTS 是第一个对 词元级 内容持续时间和暂停进行显式本地时序控制的 TTS 模型。 MAGIC-TTS 是通过明确的 词元级 持续时间条件、精心准备的高置信度持续时间监督以及纠正零值偏差并使模型对丢失的本地控制具有鲁棒性的训练机制来实现的。在我们的时序控制基准测试中,MAGIC-TTS 显着改善了自发合成的 词元级 持续时间和暂停。即使不提供时序控制,MAGIC-TTS 也能保持自然的高质量合成。我们通过基于场景的基准进一步评估实际的本地编辑,涵盖导航指导、引导阅读和面向可访问性的代码阅读。在此设置中,MAGIC-TTS 实现了可重复的统一定时基线,然后将编辑的区域移向具有低平均偏差的所请求的本地目标。这些结果表明,显式细粒度可控性可以在高质量 TTS 系统中有效实现,并且可以支持现实的本地定时编辑应用。