论文

ReCaVSR:具有回收潜伏和学习缓存路由的一步式流媒体扩散视频超分辨率

ReCaVSR: One-Step Streaming Diffusion Video Super-Resolution with Recycled Latents and Learned Cache Routing

应用与实践内容创作

摘要

在线流媒体对基于实时扩散的视频超分辨率 (VSR) 的需求很高,但严格的延迟要求往往会损害生成保真度。我们提出了 ReCaVSR,这是一种基于 Wan2.2 的一步式流式 VSR 框架,它基于两个观察结果:回收的 SR 潜伏保留本地时间上下文,减少对完整历史键值 (KV) 缓存的需求;各个Transformer层受益于不同的时间范围。 ReCaVSR 结合了三种互补的设计:(i)具有回收的 SR 潜在层的逐层缓存路由:每个 DiT 层在缓存预算下学习其 KV 缓存时间范围并导出静态推理时间表,而回收的 SR 潜在层通过根据模型自己的先前预测调节每个新块来传播本地上下文。 (ii) 多范围查询(MSQ)鉴别器:结合全局、空间窗口和时间管反馈的组合鉴别器,以实现整体真实性、局部纹理生成和时间稳定性。 (iii) FlashDecoder 的 LR 条件适应:一种 VAE 解码器,它结合了 LR 观察以实现高效的潜在解码。 ReCaVSR 支持流式 VSR,无需迭代采样或完整历史 KV 缓存实现。对合成和现实世界 VSR 基准的实验表明,与代表性 VSR 基准相比,感知质量、时间一致性和流传输效率更好。在单个 NVIDIA A100-80GB 上的输出分辨率为 1080{\times}1920$ 时,ReCaVSR 可在 15.16 GB 峰值分配 GPU 内存下实现 21.20 FPS,运行速度快 2.72$\times$,同时使用比 FlashVSR Tiny 少 38.0\% 的峰值分配内存。该代码可在 https://github.com/kopperx/ReCaVSR. 获取