论文
ViBe:纯图像诞生的超高分辨率视频合成
ViBe: Ultra-High-Resolution Video Synthesis Born from Pure Images
摘要
基于 Transformer 的视频扩散模型依赖于空间和时间标记的 3D 注意力,这会导致时间和内存复杂性成倍增加,并使超高分辨率视频的端到端训练成本过高。为了克服这个瓶颈,我们提出了一个纯图像适应框架,该框架升级了以其本机规模预训练的视频扩散 Transformer 以合成更高分辨率的视频。不幸的是,由于图像-视频模态差距,仅使用高分辨率图像的天真 微调 通常会引入明显的噪声。为了解决这个问题,我们将学习目标解耦,分别处理模态对齐和空间外推。我们方法的核心是 Relay LoRA,这是一种两阶段适应策略。在第一阶段,视频扩散模型适应图像域,使用低分辨率图像来弥合模态差距。在第二阶段,模型进一步适应高分辨率图像以获得空间外推能力。在推理过程中,仅保留高分辨率自适应,以保留视频生成模式,同时实现高分辨率视频合成。为了增强细粒度的细节合成,我们进一步提出了高频感知训练目标,它明确鼓励模型通过专用的重建损失从退化的潜在表示中恢复高频分量。大量实验表明,我们的方法无需任何视频训练数据即可生成具有丰富视觉细节的超高分辨率视频,甚至在 VBench 基准测试中比之前在高分辨率视频上训练的最先进模型高出 0.8。代码可在 https://github.com/WillWu111/ViBe 获取。