论文
DiffST:用于真实世界时空视频超分辨率的时空感知扩散
DiffST: Spatiotemporal-Aware Diffusion for Real-World Space-Time Video Super-Resolution
摘要
基于扩散的模型在视频超分辨率(VSR)和视频帧插值(VFI)方面表现出了强大的性能。然而,它们在耦合时空视频超分辨率(STVSR)设置中的作用仍然有限。现有的基于扩散的 STVSR 方法存在两个问题:(1)推理效率低;(2)时空信息利用不足。这些限制阻碍了部署。为了解决这些问题,我们引入了 DiffST,一种用于现实世界 STVSR 的高效时空感知视频扩散框架。为了提高效率,我们采用预训练的扩散模型进行一步采样,并直接处理整个视频,而不是对单个帧进行操作。此外,为了增强时空信息利用率,我们引入了跨帧上下文聚合(CFCA)和视频表示指导(VRG)。 CFCA 模块聚合多个关键帧的信息以生成中间帧。 VRG模块提取视频级全局特征来指导扩散过程。大量实验表明,DiffST 在现实世界的 STVSR 任务上取得了领先的结果。它还保持了较高的推理效率,运行速度比之前基于扩散的 STVSR 方法快约 17 倍。代码位于:https://github.com/zhengchen1999/DiffST。