论文
RelayVSR:大小型模型协作,实现高效的现实世界视频超分辨率
RelayVSR: Large-Small Model Collaboration for Efficient Real-World Video Super-Resolution
摘要
大型生成模型可以恢复现实世界视频超分辨率 (VSR) 中的真实细节,但用它们处理整个视频的计算成本很高。在这项工作中,我们提出了 RelayVSR,一个基于稀疏生成中继机制构建的流式 VSR 框架。大型生成模型为稀疏关键帧生成参考潜伏,而轻量级 VSR 网络使用这些参考和低分辨率视频来超分辨率每一帧。轻量级 VSR 网络作为双内存视频转换器实现,跨帧重用关键帧信息并更新最近的视频上下文,支持第一个关键帧调节和具有有限前瞻的双端点调节。然而,共享关键帧中的错误可能会在输出帧之间传播和累积,使得关键帧质量本身不足以成为优化目标。我们通过视频感知参考优化(VARO)来解决这一协作差距,该技术使用强化学习来更新具有两个奖励级别的大型生成模型:系统级奖励评估固定轻量级 VSR 网络生成的视频,而参考级奖励评估解码的关键帧质量。 VARO 比直接联合训练提高了最终视频质量,其双级奖励优于单独的系统级奖励。在单 NVIDIA A100 80GB 上,具有 15 帧关键帧间隔的双端点 RelayVSR 在 1080p 下达到 29.29 FPS、13.82 GB 峰值 GPU 内存和 0.327 秒的第一帧模型延迟,而 FlashVSR-Tiny 为 7.80 FPS、24.447 GB 和 2.83 秒。该代码可在 https://github.com/kopperx/RelayVSR. 获取