论文

SentiAvatar:迈向富有表现力和互动性的数字人类

SentiAvatar: Towards Expressive and Interactive Digital Humans

应用与实践内容创作

摘要

我们提出了 SentiAvatar,一个用于构建富有表现力的交互式 3D 数字人类的框架,并用它来创建 SuSu,一个可以实时说话、手势和表情的虚拟角色。实现这样的系统仍然具有挑战性,因为它需要共同解决三个关键问题:缺乏大规模、高质量的多模态数据、强大的语义到运动映射以及细粒度的帧级运动韵律同步。为了解决这些问题,我们首先构建了 SuSuInterActs(21K 剪辑,37 小时),这是一个通过光学动作捕捉围绕单个角色捕获的对话语料库,其中包含同步语音、全身动作和面部表情。其次,我们在 200K+ 运动序列上预训练运动基础模型,为其配备丰富的动作先验,远远超出对话范围。然后,我们提出了一种音频感知的计划然后填充架构,将句子级语义规划与帧级韵律驱动插值分离,以便生成的动作在语义上既合适又与语音节奏一致。实验表明,SentiAvatar 在 SuSuInterActs(R@1 43.64%,几乎是最佳基线的 2 倍)和 BEATv2(FGD 4.941,BC 8.078)上均达到了最先进的水平,在 0.3 秒内产生 6 秒的输出,并具有无限多轮流。源代码、模型和数据集可在 https://sentiavatar.github.io 获取。