论文

FA-LAM:用于一次性 4D 可动画高斯头部的焦点感知大型头像模型

FA-LAM: Focus-Aware Large Avatar Model for One-Shot 4D Animatable Gaussian Head

应用与实践内容创作

摘要

我们提出了 FA-LAM,一种焦点感知大型头像模型,用于一次性创建动画高斯头部,同时实现静态 3D 和动态 4D 全头部恢复。我们方法的核心在于对注意力机制以及先前最先进方法采用的纠缠重建和动画训练管道的彻底分析。我们的分析确定了影响 3D 全头生成质量的两个主要因素:(1) 不正确且嘈杂的注意力激活,以及 (2) 重建任务和动画任务之间的冲突。为了解决第一个问题,我们引入了一种对称和语义注意正则化策略,该策略利用人类头部的固有语义和结构对称性。为了理清重建和动画的目标,我们开发了一种新颖的双阶段训练管道,将模型的大视图幻觉和动画功能分为不同的模块。此外,我们通过核心自回归修改和定制的可见性感知词元融合,增强了我们的模型,以高效且内存友好的方式支持多视图和流式 4D 重建。总的来说,这些创新使 FA-LAM 能够以卓越的质量重建可动画的高斯全头,特别是在精细的面部区域和大视角方面。