论文
ShotStream:用于交互式讲故事的流式多镜头视频生成
ShotStream: Streaming Multi-Shot Video Generation for Interactive Storytelling
摘要
多镜头视频生成对于长篇叙事故事至关重要,但当前的双向架构存在交互性有限和延迟高的问题。我们提出了 ShotStream,一种新颖的因果多镜头架构,可以实现交互式故事讲述和高效的动态帧生成。通过将任务重新表述为以历史背景为条件的下一个镜头生成,ShotStream 允许用户通过流提示动态指示正在进行的叙述。我们首先将 微调 将文本到视频模型转换为双向下一个镜头生成器,然后通过分布匹配 蒸馏 将其提炼为因果学生来实现此目的。为了克服自回归生成中固有的镜头间一致性和误差积累的挑战,我们引入了两项关键创新。首先,双缓存机制保持视觉连贯性:全局上下文缓存保留条件帧以实现镜头间一致性,而本地上下文缓存则保留当前镜头内生成的帧以实现镜头内一致性。并且采用 RoPE 不连续性指示器来明确区分两个缓存以消除歧义。其次,为了减轻错误累积,我们提出了两阶段 蒸馏 策略。首先以 真值 历史镜头为条件的镜头内自我强迫,并逐步扩展到使用自我生成的历史记录的镜头间自我强迫,有效地弥合了训练测试差距。大量实验表明,ShotStream 可以生成亚秒级延迟的连贯多镜头视频,在单个 GPU 上实现 16 FPS。它的质量与较慢的双向模型相当或超过,为实时交互式讲故事铺平了道路。训练和推理代码以及模型可在我们的网站上找到