论文

PortraitDirector:用于可控和实时面部重演的分层解开框架

PortraitDirector: A Hierarchical Disentanglement Framework for Controllable and Real-time Facial Reenactment

应用与实践内容创作

摘要

现有的面部重现方法难以在表现力和细粒度可控性之间进行权衡。整体面部重现模型通常会为了表现力而牺牲精细控制,而为控制而设计的方法可能会在保真度和强大的解缠度方面遇到困难。我们没有将面部运动视为单一信号,而是探索另一种构图视角。在本文中,我们介绍了PortraitDirector,这是一种新颖的框架,它将面部重演制定为分层构图任务,实现了高保真且可控的结果。我们采用分层运动解缠和合成策略,将面部运动解构为用于物理运动的空间层和用于情感内容的语义层。空间层包括:(i)全局头部姿势,通过专用表示和注入路径进行管理; (ii)空间上分离的局部面部表情,从裁剪的面部区域中提取出来,并通过利用信息瓶颈的情绪过滤模块清除情绪线索。语义层包含派生的全局情感。然后,解开的成分被重新组合成潜在的表现力运动。此外,我们通过一系列优化设计了实时性能框架,包括扩散 蒸馏、因果注意力和 VAE 加速。 PortraitDirector 在单个 5090 GPU 上以 20 FPS 实现流式传输、高保真、可控的 512 x 512 面部重演,端到端延迟为 800 毫秒。