论文
MegaAvatar:可控的说话头像生成
MegaAvatar: Controllable Talking Avatar Generation
摘要
本报告介绍了 MegaAvatar,这是一个构建在 Wan2.2-TI2V-5B 模型之上的可控说话化身生成框架。与之前主要依赖于音频或参考图像调节的说话化身方法相比,我们引入了额外的 SMPL-X 衍生的 3D 引导,从而能够对身体姿势和头部运动进行全局控制。具体来说,我们将驱动 SMPL-X 序列渲染为密集网格帧,并使用轻量级 3D 卷积编码器对其进行编码,其输出被注入到潜在词元中以提供整体运动控制。此外,我们使用额外的音频和面部交叉注意模块扩展了 Wan2.2-TI2V-5B,以分别实现细粒度的表情控制和保留输入身份。此外,我们还实现了音频到 SMPL-X 模型来预测以参考图像和输入音频为条件的 SMPL-X 序列,从而使 MegaAvatar 能够支持音频驱动的推理,而无需用户提供 SMPL-X 帧。实验表明,MegaAvatar 可实现高质量的会说话的化身生成,具有可控制的身体和头部运动、语音同步的面部表情以及一致的身份保存。 MegaAvatar 还支持灵活的分辨率和视频长度的推理。代码、数据集、模型将在https://github.com/Jeoyal/MegaAvatar中提供