论文

迷你世界:从头开始民主化视频世界模型的训练

MiniWorld: Democratizing the Training of Video World Models from Scratch

模型训练预训练

摘要

视频世界模型根据历史观测和控制信号预测未来观测,从而通过自回归状态转换实现长视野生成。与主要捕获视觉外观和运动的传统视频生成模型不同,视频世界模型学习在代理动作下控制环境演化的底层动态,为具体人工智能和交互式模拟提供基础。最近的进展很大程度上依赖于通过 后训练 或 蒸馏 调整预训练视频生成模型。尽管有效,但这些方法通常需要复杂的训练管道、大量的计算资源,并且受到双向预训练和因果流推理之间不匹配的影响。最近的研究表明,从头开始训练自回归视频世界模型是可行且可扩展的。然而,社区仍然缺乏一个轻量级、透明且完全可重现的基线,可通过适度的计算资源进行端到端训练。我们提出了 MiniWorld,这是一个可重现的框架,用于从头开始训练流视频世界模型。 MiniWorld 采用了块因果视频扩散 Transformer,在预训练视频 VAE 的潜在空间中通过流匹配进行训练。它以扩散强迫为基础,采用分块非递减噪声计划和两阶段持续训练来提高时间建模和稳定性。在推理过程中,MiniWorld 将滚动 KV 缓存与流水线异步降噪相结合,以在有界计算下实现高效的流生成。整个模型可以在几天内在单个 8-GPU 服务器上进行训练。通过发布训练和推理代码库以及预训练检查点,我们希望 MiniWorld 能够促进未来视频世界建模的研究。