论文

大规模编解码头像:大规模头像预训练的不合理效果

Large-scale Codec Avatars: The Unreasonable Effectiveness of Large-scale Avatar Pretraining

模型训练预训练

摘要

高质量 3D 头像建模面临着保真度和泛化之间的关键权衡。一方面,多视图工作室数据可以通过精确控制表情和姿势来对人类进行高保真建模,但由于规模有限以及工作室环境与现实世界之间的域差距,它很难推广到现实世界的数据。另一方面,最近在数百万个野外样本上训练的大规模化身模型显示出对广泛身份进行泛化的希望,但由于固有的 3D 模糊性,生成的化身通常质量较低。为了解决这个问题,我们提出了大规模编解码器化身 (LCA),这是一种高保真、全身 3D 化身模型,可以前馈方式推广到世界范围的人群,从而实现高效的推理。受 大语言模型 和视觉基础模型成功的启发,我们首次提出了用于大规模 3D 头像建模的 pre/后训练 范式:我们对 100 万个野外视频进行预训练,以了解外观和几何形状的广泛先验知识,然后对高质量的精选数据进行后训练,以增强表现力和保真度。 LCA 概括了发型、服装和人口统计数据,同时提供精确、细粒度的面部表情和手指级清晰度控制,具有强大的身份保留功能。值得注意的是,尽管缺乏直接监督,我们观察到对可重照性的新兴泛化和对无约束输入的宽松服装支持,以及对风格化图像的零镜头鲁棒性。