论文

代理头像遇到低秩缓存:实时一次性情感可控肖像动画

Proxy Avatar Meets Low-Rank Caching: Real-Time One-Shot Emotion-Controllable Portrait Animation

应用与实践内容创作

摘要

音频驱动的肖像动画通过基于扩散的生成模型迅速发展,但具有表达情感控制的实时一次性生成仍然具有挑战性。现有方法常常面临情感感知运动先验不足和多步去噪过程中昂贵的外观计算的问题。为了解决这些问题,我们提出了代理头像满足低秩缓存,这是一种用于实时单镜头情感可控肖像动画的级联框架。我们的方法不是直接从音频生成目标肖像,而是使用基于高斯的情感代理化身作为可重复使用的运动生成器,该生成器在单个身份上进行一次训练,以根据音频和情感标签生成富有表现力的驾驶视频。由于代理头像仅提供运动而不是目标外观或几何形状,因此大规模一次性重定向模型进一步从代理性能中提取与身份无关的运动,并将其适应任意目标肖像。为了提高推理效率,我们引入了具有低秩缓存的零样本外观重用,它在初始去噪步骤中缓存参考外观特征,并使用轻量级低秩适配器对后续特征变化进行建模。大量实验表明,我们的方法实现了更强的情感表达、更好的身份保留动画,并大幅降低了推理成本,从而实现了实时的一次性肖像动画。