论文

SyncCache:利用非对称动态实现快速音频驱动的肖像动画

SyncCache: Exploiting Asymmetric Dynamics for Fast Audio-Driven Portrait Animation

模型推理推理加速

摘要

Diffusion Transformer (DiTs) 具有显着先进的音频驱动肖像动画,但其高计算成本导致大量推理延迟。尽管 无需训练 扩散缓存显着加速了推理,但现有方法主要是为文本条件生成而开发的,并且忽略了音频驱动的肖像动画中固有的空间和模态不平衡。在本文中,我们提出了 SyncCache,这是一种为基于 DiT 的肖像动画量身定制的 无需训练 缓存加速方法,该方法显式地利用了非对称动态。具体来说,与肖像动画中的低频视觉背景相比,由音频条件驱动并集中在人体区域的高频动态对于缓存和重用来说更具挑战性和关键性。首先,我们引入空间不对称探测来优先考虑动态人体区域中的错误敏感性。其次,通过模态解耦缓存,我们通过重用稳定的块间残差来绕过重型 DiT 块,同时不断重新计算轻量级音频块以保持精确的唇形同步。此外,我们引入了缓存比率来控制缓存容量,并将内存自适应缓存选择制定为离线动态编程问题,无需在线开销。大量实验表明,SyncCache 实现了卓越的速度与质量权衡,在 HunyuanVideo-Avatar 上提供高达 4.12 倍的加速,在 Wan-S2V 上提供高达 3.75 倍的加速,并具有近乎无损的视觉保真度和精确的音频对齐。