论文

ComplexSync:复杂场景下的高保真实时唇音同步

ComplexSync: High-Fidelity and Real-Time Lip Sync in Complex Scenarios

摘要

唇形同步旨在生成与语音音频精确对齐的视觉唇形动态。尽管扩散模型的生成质量很高,但它们经常在复杂的场景中陷入困境,并遭受令人望而却步的推理延迟,限制了现实世界的部署。我们推出了 ComplexSync,这是一个基于扩散的统一框架,可在复杂条件下实现实时、高保真唇形同步。首先,我们引入双流联合训练策略,以减少参考帧的信息泄漏,同时保留自然动态。其次,我们开发了一种基于蒸馏的单步去噪加速方案,实现了超过 70 FPS 的吞吐量。第三,我们提出了一种关系对齐损失,它利用视觉基础模型(VFM)的结构先验来增强针对复杂场景因素的鲁棒性。此外,我们还推出了第一个专为复杂唇形同步设计的基准测试,其中包括 200 多个具有挑战性的视频序列和专门指标。大量实验表明,ComplexSync 在标准和复杂场景中均实现了最先进的性能,同时支持实时推理。