论文
PixReenact:用于流媒体头部头像重演的像素条件因果视频扩散
PixReenact: Pixel-Conditioned Causal Video Diffusion for Streaming Head-Avatar Reenactment
摘要
流媒体头部头像重演旨在根据实时驾驶视频制作参考图像的动画,需要强大的运动传输、长期身份稳定性和低延迟。现有方法通常依赖于专门的身份或运动表示,这可能会丢弃有用的视觉信息并从外部提取器继承故障模式。此外,许多最近的基于扩散的重演方法使用离线、基于剪辑的生成,在生成输出之前对整个视频剪辑进行联合处理和去噪,这使得连续低延迟流传输变得困难。我们介绍 PixReenact,一个基于因果视频扩散的像素条件流重演框架。 PixReenact 直接在 VAE 编码的参考帧和驾驶帧上设置条件,无需专门的身份或运动表示。为了将参考身份与驾驶员运动分开,我们使用跨身份伪监督以及锚定到原始参考和驾驶输入的纠正目标进行训练。长自执行轨迹减少自回归漂移,而状态感知双教师模型蒸馏分别解决冷启动和稳态生成问题。在三个跨身份基准和一个长范围流媒体基准中,PixReenact 展示了强大的跨身份重演能力,特别是在极端视点、遮挡和明显的面部表情等具有挑战性的条件下,同时在长流中保持参考身份。 4-NFE 滚动学生模型每次更新连续发射四帧,平均发射延迟为 239 毫秒。
