论文

奇迹:视频世界模型做得更好

Wonder: Video World Model Done Better

模型推理解码与生成控制

摘要

我们推出了 Wonder,一种通用视频世界模型,用于实时、摄像机控制的世界探索。给定图像或条件视频,Wonder 构建了一个可玩的世界,用户可以通过移动相机进行交互导航,发现未见过的区域,并在长期范围内实时重新访问以前观察到的区域。实现这种能力需要控制方法、存储机制和训练策略的系统级协同设计。我们引入了一种新颖的相机调节,具有密集的坐标场,其渲染提供了空间对齐的运动和方向线索,允许模型将相机运动直接解释为视觉证据。为了支持在不断增长的一代上下文中快速、精确的记忆检索,我们提出了一种高效的基于稀疏注意力的记忆机制,使模型能够在推理时选择性地关注一小组相关的上下文标记,而不管实际的上下文长度如何。我们进一步开发了几种技术来纠正自强迫式 蒸馏 管道,提高学生模型尊重控制信号的能力,并保持教师的多样化生成模式和长期记忆。这些组件共同使 Wonder 能够以 16 FPS 合成多样化的分钟级视频,同时在长时间发布过程中保持连贯的几何形状、外观和动态。除了图像到视频的生成之外,Wonder 还自然支持视频调节生成,允许实时重新拍摄现有的动态场景。