论文
SwiftI2V:通过条件分段生成高效的高分辨率图像到视频生成
SwiftI2V: Efficient High-Resolution Image-to-Video Generation via Conditional Segment-wise Generation
摘要
高分辨率图像到视频 (I2V) 生成旨在合成真实的时间动态,同时保留输入图像的细粒度外观细节。在 2K 分辨率下,这变得极具挑战性,并且现有的解决方案存在各种弱点:1)端到端模型在内存和延迟方面通常非常昂贵; 2)使用通用视频超分辨率进行级联低分辨率生成往往会产生细节幻觉,并且会偏离特定于输入的局部结构,因为超分辨率阶段没有明确地以输入图像为条件。为此,我们提出了 SwiftI2V,一个专为高分辨率 I2V 量身定制的高效框架。遵循广泛使用的两阶段设计,它首先生成低分辨率运动参考以降低词元成本并减轻建模负担,然后执行由运动引导的强图像条件 2K 合成,以在控制开销的情况下恢复输入忠实的细节,从而解决了效率保真度困境。具体来说,为了使生成更具可扩展性,SwiftI2V引入了条件分段生成(CSG),以每步有界的词元预算逐段合成视频,并在每个分段内采用双向上下文交互来提高跨分段的一致性和输入保真度。在 2K 分辨率的 VBench-I2V 上,SwiftI2V 实现了与端到端基线相当的性能,同时将总 GPU 时间减少了 202 倍。特别是,它可以在单个数据中心 GPU(例如 H800)或消费类 GPU(例如 RTX 4090)上生成实用的 2K I2V。