论文
KM-Speaker:基于关键点的风格控制,用于高质量语音驱动的 3D 面部动画和对话本地化
KM-Speaker: Keypoint-Based Style Control for High-Quality Speech-Driven 3D Facial Animation and Dialogue Localization
摘要
语音驱动的 3D 面部动画方法在同时实现高保真运动和精确的艺术控制以及生产质量方面面临着重大挑战。现有的可控模型通常通过依赖大规模、低质量的\emph{in-the-wild}数据集来学习全局风格控制,这会损害整体动画的真实感。此外,这些框架通常缺乏对话定位(例如配音)等要求较高的任务所需的细粒度时间精度,其中匹配特定的面部表情与唇形同步一样重要。我们提出了 KM-Speaker(关键点匹配说话人),这是一种新颖的基于关键点条件的流生成框架,它提供全局风格指导和来自参考性能的帧级时间控制。我们提出了一种解缠结策略,将音频驱动的嘴唇运动与关键点驱动的上脸动态分开,以及全局样式上下文保存机制,以确保连贯的全脸表现力。 KM-Speaker 通过在数据受限的环境中实现高保真运动和灵活的可控性来推进基于示例的 3D 面部动画,在口型同步准确性、风格一致性和表达时间控制方面始终优于最先进的方法。