论文
使用文本到图像潜在扩散模型和多模态参考进行零镜头视频恢复和增强
Zero-Shot Video Restoration and Enhancement with Text-to-Image Latent Diffusion Models and Multi-Modal References
摘要
使用文本到图像潜在扩散模型的零样本图像恢复方法在无需训练的通用图像恢复任务中取得了巨大成功。然而,将它们应用于视频修复会导致严重的时间闪烁。在本文中,我们提出了一种零镜头视频恢复和增强的新颖框架,该框架使用文本到图像的潜在扩散模型和多模态参考。通过所提出的双重提示调整反演和采样,推理时间可以减少到原来的近1/3。性能和时间一致性也可以显着增强。通过使用所提出的纹理感知视频词元合并,可以进一步利用帧之间的时间相关性来提高时间一致性。我们进一步提出引用自注意力和引用词元合并来支持图像引用。实验结果证明了该方法在恢复和增强时间一致视频方面的优越性。