论文
多语言:保留多语言风格的语音驱动的面部动画
Polyglot: Multilingual Style Preserving Speech-Driven Facial Animation
摘要
语音驱动面部动画(SDFA)因其在电影、视频游戏和虚拟现实中的应用而受到广泛关注。然而,大多数现有模型都是基于单语言数据进行训练的,这限制了它们在现实世界多语言场景中的有效性。在这项工作中,我们解决了多语言 SDFA 问题,这对于现实生成至关重要,因为语言会影响语音、节奏、语调和面部表情。说话风格不仅取决于语言,还取决于个体差异。现有方法通常依赖于特定于语言或特定于说话者的调节,但不能同时依赖于两者,这限制了它们建模交互的能力。我们引入了 Polyglot,这是一种基于统一扩散的个性化多语言 SDFA 架构。我们的方法使用转录嵌入对语言信息进行编码,并使用从参考面部序列中提取的风格嵌入来捕获个人的说话特征。多语言不需要预定义的语言或说话人标签,可以通过自我监督学习实现跨语言和说话人的泛化。通过共同调节语言和风格,它捕捉节奏、清晰度和习惯性面部动作等表达特征,产生时间连贯且逼真的动画。实验表明单语言和多语言环境中的性能都有所提高,为 SDFA 中的语言和个人风格建模提供了统一的框架。