论文
MindFlow:协调认知语义和声学动力学,以生成二元对话中的面部动画
MindFlow: Harmonizing Cognitive Semantics and Acoustic Dynamics for Facial Animation Generation in Dyadic Conversations
摘要
为二元对话生成逼真的面部动画需要协调高级认知意图与精确的底层运动反射,但现有方法在对话上下文的语义理解和精确的动态控制方面存在不足。在本文中,我们提出了 MindFlow,这是一种受神经科学中的腹背通路模型启发的双通路生成框架,它将生成解耦为两个协作流,从而协调深度语义推理与细粒度控制。在 Ventral 模块中,我们将传统的句子-动作方法转变为一种新颖的块状态方法,该方法将原始声学流建模为上下文感知、不断发展的情感状态链,捕捉句子级建模所错过的微妙的副语言细微差别和中间话语情感转变。 Dorsal 模块具有用于高保真面部运动的条件自回归流匹配网络,由高频声学线索驱动并由情绪状态调制,以及用于自适应音频门控的选择性声学注入器,以确保说和听动态的鲁棒性而不受干扰。大量实验表明,与最先进的基线相比,MindFlow 实现了卓越的语义适当性和运动自然度。