论文

PS-TTS:文本转语音中的语音同步,实现自然的自动配音

PS-TTS: Phonetic Synchronization in Text-to-Speech for Achieving Natural Automated Dubbing

应用与实践内容创作

摘要

近年来,基于人工智能的配音技术取得了进步,可以实现自动配音(AD),将视频的源语音转换为不同语言的目标语音。然而,自然广告仍然面临同步挑战,例如持续时间和口型同步(lip-sync),这对于保持观看者体验至关重要。因此,本文提出了一种用于释义翻译文本的 AD 过程的同步方法,包括两个步骤:时间约束的等时性和保持口型同步的语音同步(PS)。首先,我们通过使用语言模型解释翻译文本来实现等时性,确保目标语音持续时间与源语音持续时间匹配。其次,我们介绍 PS,它采用动态时间规整(DTW)和从训练数据测量的元音距离的局部成本,以便目标文本组成发音与源元音相似的元音。第三,我们将这种方法扩展到 PSComet,它联合考虑语义和语音相似性以更好地保留含义。所提出的方法被纳入文本转语音系统、PS-TTS 和 PS-Comet TTS 中。使用韩语和英语唇读数据集以及配音演员配音数据集进行的性能评估表明,这两个系统在多个客观指标上都优于没有 PS 的 TTS,并且在韩语到英语和英语到韩语配音方面优于配音演员。我们将实验扩展到法语,测试这些语言之间的所有对以评估跨语言适用性。在所有语言对中,PS-Comet 表现最好,平衡了口型同步准确性和语义保留,证实 PS-Comet 比单独的 PS 实现了更准确的口型同步和语义保留。