论文
HighSync:通过潜在扩散模型实现高质量唇形同步
HighSync: High-Quality Lip Synchronization via Latent Diffusion Models
摘要
我们推出了 HighSync,这是一种基于端到端扩散的高保真唇形同步框架,可生成与任意输入音频对齐的逼真的说话脸部视频。现有的方法始终难以协调图像质量与同步精度,从而产生视觉效果下降的输出或暂时不一致的嘴唇运动。 HighSync 同时解决了这两个挑战,据我们所知,它是第一个以 512*512 分辨率本地运行的唇形同步模型,将其定位为电影和广播行业等专业制作环境的可行解决方案。我们方法的核心是识别并系统地消除数据泄漏现象,这种现象悄悄地破坏了先前工作中的时间建模,防止模型发展出对音频信号的真正依赖。对感知质量和同步精度指标的综合评估证实 HighSync 在这两个方面都实现了最先进的性能。源代码、预训练模型和补充视频结果可在以下位置公开获取:https://github.com/saeed5959/high_sync