论文
CineOrchestra:用于电影视频生成的统一以实体为中心的调节
CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation
摘要
电影视频描绘了多个主体在特定时刻的行为或互动,通过有意的摄像机移动来捕捉,并通过镜头过渡缝合在一起。这些元素共同要求超越当前文本到视频模型的细粒度控制。现有的工作单独解决每个轴:多主体个性化、时间控制、多镜头合成或相机控制;之前没有任何框架能够将这四种技术联合起来。我们推出了 CineOrchestra,这是一种统一的视频扩散模型,可以同时控制主题、事件、摄像机和镜头过渡。我们的主要见解是,这些异构电影元素共享一个基本结构:每个元素都是在特定时间间隔内起作用的实体,因此都可以通过以实体为中心的调节基元的一个共享结构来表达,并通过视觉实体的参考图像进行增强。这种公式减少了对单个位置编码问题的架构挑战,我们通过两个无参数的协调旋转嵌入来解决这个问题:(a)间隔采样的时间 RoPE,它在持续时间显着变化的事件中产生一致的注意力行为,以及(b)2D 实体-时间交叉注意力 RoPE,它消除每个实体条件的歧义并将每个条件路由到其相应的时空区域。在两项新的基准测试中,CineOrchestra 在密集视频描述跟随和镜头转换计时方面优于六名每轴专家,并在成对用户研究和组件消融方面取得了一致的进步。项目页面:https://snap-research.github.io/CineOrchestra