论文
唇部强制:用于实时唇部同步的少步自回归扩散
Lip Forcing: Few-Step Autoregressive Diffusion for Real-time Lip Synchronization
摘要
基于扩散的唇形同步模型实现了强大的视觉质量和视听对齐,但全序列双向注意力和许多去噪步骤使得它们对于实时推理来说不切实际。据我们所知,我们提出了 Lip Forcing,这是第一个用于视频到视频 (V2V) 唇同步的自回归扩散方法,该方法将 14B 音频调节双向视频扩散教师提炼为因果学生。在推理时,学生只需两个去噪步骤即可生成每个块,无需推理时 CFG,从而实现实时唇形同步。特定于口型同步的教师轨迹分析揭示了 CFG 保真度同步权衡:无 CFG 预测有利于参考保真度,而 CFG 引导预测有利于中间轨迹带内的同步。 Lip Forcing 将这一发现转化为三个分析衍生组件:Sync-Window DMD、两步推理计划和基于 SyncNet 的奖励。我们在两个学生级别上验证了唇部强迫,这两个级别都是从 14B 老师那里提炼出来的。 1.3B 学生以 31 FPS 进入实时流媒体,比同规模的双向模型快 17.6倍。 14B 学生是用于 V2V 唇形同步的最大扩散模型,在可比较的参考保真度下,其运行速度比其教师快 39.8倍。在两个尺度上,第一帧的时间都是亚毫秒级的,远低于每个扩散基线。