论文
LiteVSR:针对视频超分辨率的 Frozen Diffusion Transformer 的轻量级改编
LiteVSR: Lightweight Adaptation of Frozen Diffusion Transformers for Video Super-Resolution
摘要
在新领域中采用大规模预训练视频生成器来实现视频超分辨率(VSR)在计算上仍然令人望而却步。将生成重新表述为直接低质量到高质量映射的方法偏离了原始生成表述,需要广泛的 微调。 ControlNet 式适配器在现代 Diffusion Transformer 下会失去效率,因为编码器-解码器层次结构的缺失迫使整个骨干网的重复。我们观察到流匹配为跨域 VSR 适应提供了原则性的替代方案。通过预测所有时间步长的恒定速度场,适应任务减少为学习固定的注入模式而不是随时间变化的变换。基于这一见解,我们提出了 LiteVSR,这是一个极简框架,它使用完全冻结的 Diffusion Transformer 和轻量级状态感知适配器来执行 VSR。该适配器采用双流架构,从 LQ 输入中提取静态结构线索,从中间去噪状态中提取动态线索,通过时间相关的交叉注意力对它们进行对齐,以便随着去噪的进行,实现从结构对齐到纹理细化的自适应过渡。 LiteVSR 在单个 A100 上仅需 11.25% 的可训练参数和 12 个 GPU 小时的训练即可实现具有竞争力的恢复质量,同时保持快速采样(低至单步)兼容性。