论文

LiveAnimate:稳定的实时长格式流人类动画

LiveAnimate: Stable Long-Form Streaming Human Animation in Real-Time

摘要

姿势驱动的人体动画根据单个参考图像和驾驶姿势流合成目标人的视频。实时生成对于实时流媒体、远程呈现和虚拟化身等交互式应用程序至关重要,但基于扩散的系统每个剪辑需要几分钟到几小时,从而妨碍了响应式交互。据我们所知,我们推出的 LiveAnimate 是第一个将实时流媒体与十亿级稳定长格式生成相结合的动画系统,该系统基于 14B 参数视频 Diffusion Transformer (DiT) 构建。两阶段训练管道首先通过参考锚定教师强制适应将预训练的双向 DiT 适应块因果自回归生成器,然后通过块式自强制 蒸馏 将采样预算减少到三个步骤。为了保留扩展流上的外观,我们引入了姿势检索接收器注意(PR-Sink),这是一种有界 KV 缓存机制,结合了永久锚定第一个生成块的静态接收器、保存姿势检索历史块的动态接收器和三槽滚动窗口。当姿势重复出现时,PR-Sink 会恢复相关的外观上下文而不保留整个序列,因此无论流持续时间如何,内存和每块延迟都保持不变。这些设计与 Ulysses 序列并行性和运算符融合相结合,可在两个 NVIDIA H100 GPU 上实现 19.63\,FPS 流式推理。在三分钟基准测试中,LiveAnimate 从前 30 秒到最后一分钟保持几乎恒定的感知质量和特性,而之前的系统性能大幅下降,或者需要数小时的离线计算才能完成相同的生成轨迹。这些结果在交互式全身动画的质量、延迟和持续时间方面建立了新的操作点。