论文
MosaiChunk:合成时空内存以生成自回归视频
MosaiChunk: Compositing Spatio-Temporal Memory for Autoregressive Video Generation
摘要
长程自回归视频生成受到有限上下文窗口的限制。当一个物体或场景脱离上下文时,其细粒度的视觉细节可能会丢失,并且在重新出现时很难恢复。为了保留对此类视觉细节的访问,我们引入了 MosaiChunk,这是一种时空记忆机制,可将选定的跨空间和时间的历史键值 (KV) 条目组成马赛克。我们的方法的动机是观察到冻结视频生成器可以直接消耗这种不连续的历史 KV 并恢复相应的视觉内容。因此,我们保持生成器固定,只学习一个轻量级路由器,该路由器确定在固定的活动内存预算下将哪些历史部分包含在马赛克中。我们进一步介绍了 RememBench,这是一个长期回顾的基准测试,具有提示驱动的文本到视频 (T2V) 和摄像头驱动的图像到视频 (I2V) 分割。我们的实验表明,在 T2V 和 I2V 设置中,在匹配的内存预算下,MosaiChunk 始终提高了滑动窗口推理和整个块检索的重访一致性。