论文

DreamShot:具有视频扩散优先级的个性化故事板合成

DreamShot: Personalized Storyboard Synthesis with Video Diffusion Prior

应用与实践内容创作

摘要

故事板合成在视觉叙事中起着至关重要的作用,旨在生成连贯的镜头序列,以一致的角色、场景和过渡在视觉上叙述电影事件。然而,现有的方法大多改编自文本到图像的扩散模型,这些模型很难在多个镜头中保持长期的时间连贯性、一致的角色身份和叙事流。在本文中,我们介绍了 DreamShot,一种基于视频生成模型的故事板框架,它充分利用强大的视频扩散先验来实现可控的多镜头合成。 DreamShot 支持文本到镜头和参考到镜头生成,以及以先前帧为条件的故事延续,从而实现灵活且上下文感知的故事板生成。通过利用视频生成模型固有的时空一致性,DreamShot 可以生成视觉和语义上连贯的序列,并提高叙事保真度和角色连续性。此外,DreamShot 还包含一个多参考角色调节模块,该模块接受多个角色参考图像,并通过角色注意力一致性损失强制身份对齐,明确限制参考角色和生成角色之间的注意力。大量实验表明,与最先进的文本到图像故事板模型相比,DreamShot 实现了卓越的场景连贯性、角色一致性和生成效率,为可控视频模型驱动的视觉叙事建立了新方向。