论文
UniTemp:通过双向解锁任意时间顺序的视频生成 蒸馏
UniTemp: Unlocking Video Generation in Any Temporal Order via Bidirectional Distillation
摘要
自回归视频扩散模型已成为长视频生成的一种有前途的方法,在流媒体设置中实现了强大的性能。然而,现有的方法仅限于前向时间生成,而实际的视频创建通常需要灵活的生成顺序,例如,以未来上下文为条件来向后扩展,或者以过去和未来上下文为条件来进行中间生成。我们通过训练支持任意时间方向生成的自回归模型来弥补这一差距。视频扩散模型中广泛使用的因果 3D VAE 产生了一个关键的技术挑战,该模型严格根据过去的上下文对潜伏进行编码。虽然适合前向生成,但当生成向后进行时,这种因果结构会导致块间不连续。为了解决这个问题,我们引入了块级锚定潜在变量,这是一组辅助潜在变量,可在向后生成期间恢复块边界处丢失的过去上下文。在此设计的基础上,我们提出了 UniTemp,这是一种双向 蒸馏 框架,可训练用于任意方向视频生成的单个自回归学生模型。在推理时,UniTemp 以任意过去和/或未来帧为条件,提高了双向和中间生成的可控性。实验表明,与仅前向方法相比,UniTemp 在短视频和长视频生成方面保持了具有竞争力的性能,同时支持多种工作流程,例如双向视频扩展、中间生成、循环视频生成、场景转换和视觉故事生成。项目网站:https://lzhangbj.github.io/projects/unitemp/