论文

CausalCine:多镜头视频叙事的实时自回归生成

CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives

模型推理KV Cache

摘要

自回归视频生成旨在实时、开放式合成。然而,电影叙事并不仅仅是单个场景的无限延伸;而是一个场景的无限延伸。它需要不断发展的事件、视角的转变和离散的镜头边界。现有的自回归模型常常在这种情况下陷入困境。主要针对短视界延续进行训练,他们将长序列视为延长的单镜头,在长时间展示期间不可避免地会遭受运动停滞和语义漂移的困扰。为了弥补这一差距,我们引入了 CausalCine,这是一种交互式自回归框架,可将多镜头视频生成转变为在线导演过程。 CausalCine 在镜头变化中生成因果关系,动态接受动态提示,并重用上下文而无需重新生成以前的镜头。为了实现这一目标,我们首先在本机多镜头序列上训练因果基础模型,以在加速之前学习复杂的镜头过渡。然后,我们提出内容感知内存路由(CAMR),它根据基于注意力的相关性得分而不是时间邻近度动态检索历史 KV 条目,从而在有限的活动内存下保持跨镜头的一致性。最后,我们将因果基础模型提炼成一个用于实时交互生成的几步生成器。大量实验表明,CausalCine 的性能显着优于自回归基线,接近双向模型的能力,同时解锁因果生成的流式交互性。演示地址:https://yihao-meng.github.io/CausalCine/