论文
TokTalk:来自音频的富有表现力的实时面部动画-LLM 词元
TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens
摘要
像 GPT-4o 这样的 Audio-LLM 的最新进展开创了与语言模型进行对话交互的时代。然而,对话化身在面部表情和对话流程方面仍然看起来像机器人,部分原因是语音识别、文本生成、基于回合的文本响应、语音合成和音频驱动的面部动画的连续阶段。基于我们的洞察,当前 Audio-LLM 生成的音频词元携带足够的信息来重建可信的面部表演,我们提出了 TokTalk,一个直接从流音频词元实时输出富有表现力的面部动画的系统。我们构建了一个新颖的 3D 面部运动数据集音频词元,并在该数据集上使用基于块的条件流匹配模型来训练 TokTalk。轻量级适应策略允许我们训练的模型以最小的计算开销无缝连接到任何基于词元的 Audio-LLM。通过消融研究表明,我们基于块的处理进一步实现了延迟和面部质量之间的参数权衡。我们进一步表明,TokTalk 的实时性能在延迟方面与现有技术解决方案相当,并且在 3D 面部性能的质量、表现力和控制方面非常有利(通过感知研究)。我们使用聊天机器人 Avatar、语音驱动的用户 Avatar 和动画导演界面作为各种视听面部应用程序来展示 TokTalk 的灵活性。