论文
使用参考引导深度压缩 VAE 实时生成可流式说话肖像视频
Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs
摘要
视频扩散模型具有显着先进的肖像视频生成功能,但其高计算要求限制了它们在交互式应用中的使用。这项工作提出了一个以语音音频和参考图像为条件的流式谈话肖像视频生成框架。它专为流媒体场景而精心设计,具有用于深度潜在压缩的因果视频 VAE 和自回归潜在去噪模型。我们的因果 VAE 集成了可变数量的参考图像作为指导,使网络能够专注于动态信息而不是静态外观,从而提高压缩功效和重建质量。此外,我们扩展了残差自动编码范例,以改进 VAE 中的时空因果关系处理。该生成器基于整流流 Transformer 架构,并以块式自回归方式生成视频潜伏。我们的方法能够实时生成高质量的谈话肖像视频,速度明显快于基准模型。此外,综合实验表明,它在真实性、生动性和视频质量方面与这些大型模型相当甚至优于这些模型。