论文
ShotPlan:具有可学习规划词元的电影视频生成
ShotPlan: Cinematic Video Generation with Learnable Planning Token
摘要
当前的视频生成模型在单镜头生成中取得了令人印象深刻的结果,但在电影视频生成中仍然受到限制,其中连贯的叙述和有效的多镜头合成需要明确的镜头规划。为了应对这一挑战,我们提出了 ShotPlan,这是一个基于视频扩散基础模型的显式多镜头电影视频生成框架。我们的方法引入了可学习的规划词元,可以捕获镜头级转换线索,并且可以与原始视频生成词元无缝集成以控制转换时间戳。与标准视频生成词元不同,所提出的规划词元配备了分数时间旋转位置嵌入(FRoPE),可以在帧级别对镜头过渡进行建模。实验表明,ShotPlan 显着优于现有的电影视频生成方法,提供更灵活的镜头管理和更强的镜头间一致性。