论文

不完全是我的节奏:用于唇同步配音的语音活动感知语音合成

Not Quite My Tempo: Voice Activity-aware Speech Synthesis for Lip-Synchronous Dubbing

应用与实践内容创作

摘要

自动口型同步配音需要语音合成模型来生成目标语言的交替语音和静音模式,与源剪辑的时间精确匹配,以确保最佳的观看体验。先前的工作通过根据从视频信号中提取的嘴唇运动调节语音合成过程来解决这个问题。在这项工作中,我们以二进制语音活动信号为条件生成语音,该信号具有轻量级表示形式并且可以通过多种方式产生。我们表明,该模型能够高精度地跟踪语音活动信号,同时保持句子中的自然韵律和语义上适当的停顿位置,正如通过广泛的客观和主观评估所证明的那样。通过在训练期间随机屏蔽此条件,我们使该功能在推理过程中完全可选,从而允许编辑者在需要时强制或放松口型同步约束。