论文

GenLCA:野外视频全身头像的 3D 扩散

GenLCA: 3D Diffusion for Full-Body Avatars from In-the-Wild Videos

应用与实践内容创作

摘要

我们提出了 GenLCA,这是一种基于扩散的生成模型,用于从文本和图像输入生成和编辑逼真的全身头像。生成的头像忠实于输入,同时支持高保真面部和全身动画。其核心思想是一种新颖的范式,能够从部分可观察的 2D 数据训练全身 3D 扩散模型,从而使训练数据集能够扩展到数百万个真实世界的视频。这种可扩展性有助于 GenLCA 卓越的真实感和通用性。具体来说,我们通过将预训练的前馈头像重建模型重新用作可动画的 3D 标记器来扩展数据集,该模型将非结构化视频帧编码为结构化 3D 标记。然而,大多数现实世界的视频仅提供对身体部位的部分观察,导致 3D 词元中出现过度模糊或透明伪影。为了解决这个问题,我们提出了一种新颖的可见性感知扩散训练策略,用可学习的标记替换无效区域,并仅计算有效区域的损失。然后,我们在词元数据集上训练基于流的扩散模型,本质上保持了预训练的头像重建模型提供的照片真实性和可动画性。我们的方法有效地支持使用大规模现实世界视频数据来训练本地 3D 扩散模型。我们通过多样化和高保真度的生成和编辑结果证明了我们方法的有效性,大大优于现有的解决方案。该项目页面位于 https://onethousandwu.com/GenLCA-Page。