论文

Wan-Animate-2:突破角色动画的应用界限

Wan-Animate-2: Pushing the Application Boundaries of Character Animation

应用与实践内容创作

摘要

角色图像动画仍然是计算机视觉中的一项基础但具有挑战性的任务。现有的方法可以大致分为三种范式:基于显式运动表示的方法存在提取错误和身份漂移的问题;基于隐式运动特征的方法通过压缩失去了细粒度的动态;上下文学习方法避免了中间表示,但会产生高昂的计算成本。此外,目前的系统都是离线合成,无法满足数字化身、直播主播等交互应用的实时性要求。为了解决这些限制,我们提出了 Wan-Animate-2,这是一个端到端的角色动画框架,可以直接使用重新设计的 Diffusion Transformer 中的驾驶视频。我们的架构通过完全消除中间运动提取器来实现卓越的运动保真度和身份保留。我们进一步引入了文本驱动的视点控制,它将输出摄像机视角与驾驶视频分离——这是依赖于显式运动表示的先前角色动画方法很少支持的功能。除了生成质量之外,我们还推出了 Wan-Animate-2-Lite,这是一种有效的变体,通过三阶段训练范例将推理延迟降低到实时阈值:教师强制使用错误缓冲机制进行预训练,以及使用分块反向传播的自强制 蒸馏。这使得交互式应用程序能够流式传输角色动画,从而开辟了以前不可行的新部署方案。定性评估和用户研究表明,Wan-Animate-2 在不同的角色和运动模式中实现了高保真动画效果。为了促进进一步的研究和社区发展,我们将向公众发布 Wan-Animate-2-Base 模型权重。