论文
EmoteGPT:来自自然语言描述的 3D 人类面部表情
EmoteGPT: 3D Human Facial Expressions from Natural Language Descriptions
摘要
从文本中精确控制3D面部表情对于虚拟化身、动画和人机交互至关重要,但现有的文本转3D方法共同生成身份、表情和纹理,使得细粒度的表情控制变得困难。相反,我们将文本驱动的表达式合成表述为 3D 可变形模型 (3DMM) 的解缠结参数空间中的回归问题。然而,此设置需要将详细语言链接到精确表达参数的配对数据,而现有资源中缺少这些数据。为了填补这一空白,我们引入了 Txt2Emote,它是多种 3D 面部表情的基准,具有从 GPT-4o 获得的细粒度文本注释和高保真面部跟踪器,提供详细说明面部特征的显式描述和引用表情背后情境上下文的隐式描述。利用该数据集,我们提出了 EmoteGPT,这是一种基于多模式 大语言模型 (MLLM) 的文本到 3D 表达框架,具有专用的 <Expr> 标记来语义地表达表达表示,然后将其解码为 3DMM 参数。我们通过使用大规模图像到 3DMM 数据增强训练来进一步改进 EmoteGPT,使其在情感识别指标和感知表现力方面超越最先进的文本到 3D 人脸合成方法。我们的方法集成到头像管道中,可以实现逼真且风格化的 3D 头像,以及从文本输入进行富有表现力的 3D 一致 2D 面部合成。