论文

通过级联扩散先验和 UV 空间可微分着色进行单眼头像重建

Monocular Avatar Reconstruction via Cascaded Diffusion Priors and UV-Space Differentiable Shading

应用与实践内容创作

摘要

从单个野外图像重建高保真、可重新照明的 3D 头像是一个具有挑战性的不适定问题,主要受到高质量 PBR 数据的稀缺性以及从内在材料中分离照明的复杂性的阻碍。在本文中,我们提出了一个数据高效的框架,该框架利用统一的预训练扩散主干的强大先验来顺序解决纹理完成、愉悦和材质分解问题。与依赖碎片管道或广泛专有数据集的现有方法不同,我们利用级联低秩适应(LoRA)来适应 UV 空间中每个子任务的扩散模型的强生成先验。具体来说,我们首先使用 Inpainting LoRA 来完成由于遮挡而导致的 UV 纹理缺失,利用模型的语义理解来生成语义和光度一致的细节。随后,引入了光均匀化 LoRA 和新颖的交叉内在注意力机制,以消除烘焙光照并协作合成像素对齐的 PBR 贴图(反照率、法线、粗糙度、镜面反射和位移)。为了确保物理合理性,我们在分解阶段施加了 UV 空间可微分 BRDF 着色损失,迫使生成过程遵循渲染方程,而不会出现基于光栅化的监督的典型伪影。大量实验表明,我们的方法经过不到 100 个真实 3D 扫描的训练,可生成全面的 4K 分辨率 PBR 资产,与最先进的方法相比,具有卓越的真实性和泛化性,并且所有训练代码和模型权重将在接受后发布。