论文

从词元到面部:研究 3D 面部动画的离散语音表示

From Tokens to Faces: Investigating Discrete Speech Representations for 3D Facial Animation

模型评测模型能力评测

摘要

语音表示的选择对于语音驱动的 3D 面部动画至关重要。表示形式的不同之处在于它们编码的内容:SSL 特征强调分段和语义线索,神经编解码器产生针对声学重建优化的潜伏,而 ASR 风格的目标则产生基于标签的空间。我们评估了 3D 面部合成的四个语音表示系列,使用客观指标和感知评估比较了两个面部解码器的面部重建质量。我们还进行了探索分析,将标记化表示与语音单位和发音变形联系起来。我们发现,对语音类进行编码有利于在具有可比面部动画质量的语义和基于标签的表示上进行准确的面部动画预测。从后者中,我们引入了视听文本转语音 (AVTTS) 管道,该管道利用共享空间、离散表示来解码语音和 3D 面部运动。