论文

SWIFT:用于高效交互式长视频生成的快速自适应记忆

SWIFT: Prompt-Adaptive Memory for Efficient Interactive Long Video Generation

摘要

流式长视频生成面临连续语义切换的核心挑战,需要自适应记忆来保持连贯的视觉演化。当前的方法依赖于在提示边界或固定内存预算处重建缓存,但它们引入了冗余计算并限制了灵活的语义适应。这种限制是由于缓存的视频历史记录和提示更新之间的不匹配引起的,因为记忆保留了视觉连续性,而提示切换则需要快速的语义适应。受这一观察的启发,我们提出了 SWIFT(用于灵活转换的语义窗口和注入),这是一个用于多提示长视频生成的 无需训练 框架,可实现高效的语义切换,同时保持因果视频扩散模型中的时间连贯性。 SWIFT 引入了轻量级语义注入缓存,可增强缓存视频记忆,而不是在每个提示边界从头开始重建视频记忆。为了避免均匀地扰乱所有注意力通道,我们进一步执行头式语义注入,以便每个注意力头收到与其与当前视频状态的对齐成比例的提示更新。此外,我们引入了自适应动态窗口,它根据提示阶段分配时间记忆,在切换边界附近使用较大的局部上下文,在稳定段期间使用较小的窗口,以降低平均推理成本。为了在压缩的局部注意力下保持远程语义一致性,我们进一步维护分段级语义锚,总结提示条件视频历史并将其重新引入为紧凑的记忆标记。与当前最先进的方法相比,SWIFT 在保持生成质量的同时,在单个 H100 GPU 上实现了 22.6 FPS,为多提示长视频生成建立了更加高效的解决方案。我们的代码可在 https://github.com/ShanwenTan/SWIFT 获取。