论文
CineWeaver:无需训练 参考可控多镜头长视频生成,用于电影叙事
CineWeaver: Training-Free Reference-Controllable Multi-Shot Long Video Generation for Cinematic Storytelling
摘要
由于对多镜头生成、角色和场景的细粒度可控性以及跨扩展时间范围的长格式生成的并发要求,电影视频生成对于文本到视频扩散模型来说具有挑战性。现有方法依靠定制和再训练来单独解决特定需求,并且无法通过统一的框架同时满足所有需求。在本文中,我们阐明了 无需训练 范式,其关键见解是多镜头生成的困难源于预训练视频扩散模型中对时间连续性的结构偏差,因此提出了一个名为 CineWeaver 的统一框架,以实现参考可控的多镜头长视频生成而无需重新训练。我们操纵位置编码和注意力模式来打破推理过程中的时间连续性,从而使用预先训练的视频扩散模型实现清晰的镜头过渡。此外,我们通过镜头路由参考调节机制扩展了所提出的框架,以实现每个镜头的细粒度可控性,并开发了一种锚定记忆机制,以允许具有一致的全局外观线索的长格式生成。据我们所知,CineWeaver 是第一个以 无需训练 方式同时启用 \textbf{long-form}、\textbf{reference-controllable} 和 \textbf{multi-shot} 视频生成的统一框架。实验结果表明,CineWeaver 可以生成持续时间长的高质量电影视频,具有一致的身份、稳定的全局外观和清晰的镜头过渡。该项目页面位于:https://cineweaver.github.io。