论文
SwiftVR:实时一步生成视频恢复
SwiftVR: Real-Time One-Step Generative Video Restoration
摘要
直播流的实时视频恢复 (VR) 需要在严格的每帧延迟限制下提供高分辨率输出。由于两个主要瓶颈,现有的基于扩散的一步式 VR 模型仍然难以部署在消费级 GPU 上:高分辨率下的二次空间注意力以及大型视频自动编码器的延迟内存开销。我们推出了 SwiftVR,这是一种流式单步生成 VR 框架,可以减少因果分块协议下的两个瓶颈。对于注意力,无掩码移位窗口自注意力通过确定性索引将每个空间窗口收集到密集张量中,将所有注意力调用保持在密集缩放点积注意力路径上,而无需掩码、循环移位、填充或特定于硬件的稀疏内核。由于 SwiftVR 仅使用标准密集 SDPA 调用,因此训练后的模型无需重新训练或自定义内核即可传输到消费者 GPU。对于自动编码,轻量级恢复感知自动编码器可实现快速块式解码,同时保持重建质量。在单个 H100 上,SwiftVR 在 2560x1440 下维持 31~FPS,在 3840x2160 下维持 14~FPS,而所有比较的基于扩散的 VR 基线都超过了 4K 的内存限制。在消费类 RTX~5090 上,SwiftVR 在 1920x1080 下达到 26~FPS。据我们所知,SwiftVR 是第一个在消费级 GPU 上实现实时 1080p 流媒体的生成 VR 模型,同时以较低的推理成本获得强大的无参考感知质量。项目可在 https://h-oliday.github.io/SwiftVR 获取。