论文

ForgeWM:针对少步动作条件视频世界模型的渐进因果训练

ForgeWM: Progressive Causal Training for Few-Step Action-Conditioned Video World Models

摘要

动作条件视频世界模型需要低延迟的因果生成和对游戏原生控制的可靠响应。尽管因果 蒸馏 可以实现一步或几步视频合成,但将其扩展到交互式世界模型仍然具有挑战性,因为在因果训练和自回归生成轨迹期间,离散键盘状态和连续鼠标运动必须与时间压缩的潜在块保持一致。我们介绍了 ForgeWM,这是一个渐进式框架,通过领域适应、教师强制因果训练、因果一致性 蒸馏 以及与双向教师匹配的 同策略 分布,将双向动作条件视频生成器转换为高效的少步世界模型。由此产生的预算专业学生以 1、2 和 4 步的稳态去噪预算进行操作。 ForgeWM 进一步支持双路径部署协议,将延迟关键型交互与可选的重播时间细化相结合,其中一步学生重新噪音并细化其保存的草稿。在配对的 Minecraft 轨迹上,ForgeWM 在成像质量、参考对齐运动轮廓一致性、动作信号准确性和鼠标控制准确性方面领先评估系统,同时实现最低参考 LPIPS;相同的四阶段配方转移到游戏手柄控制的 FPS 游戏中。重放时间细化与四步参考质量相匹配,同时与从噪声中再生相比,与体验轨迹的接近程度大约是三倍。这些结果证明了 ForgeWM 在可控的几步视频生成方面的有效性。