minWM:实时交互式视频世界模型的全栈开源框架
minWM: A Full-Stack Open-Source Framework for Real-Time Interactive Video World Models
摘要
最近的视频传播基础模型在高质量视频生成方面取得了显着进展,但将它们转变为实时交互式视频世界模型仍然具有挑战性。交互式世界模型需要可控、因果和低延迟的轨迹采样,这在实践中需要涵盖数据构建、可控 微调、自回归训练、少步 蒸馏 和流式推理的完整管道。在这项工作中,我们提出了 minWM,一个用于构建实时交互式视频世界模型的全栈开源框架。 minWM 提供了一个端到端管道,可将现有的双向 T2V/TI2V 视频基础模型转换为摄像机可控的几步自回归世界模型。具体来说,minWM 首先通过摄像头控制微调双向视频扩散模型,然后应用 Causal Forcing / Causal Forcing++ 管道(包括 AR 扩散训练、因果 ODE 或因果一致性 蒸馏 以及非对称 DMD)将其提炼为低延迟轨迹采样的几步自回归生成器。该框架是模块化且架构可扩展的:我们在代表性的开放主干上实例化它,包括 Wan2.1-T2V-1.3B 和 HY1.5-TI2V-8B,涵盖基于交叉注意的条件注入和 MMDiT 风格的架构。 minWM 还支持调整现有的视频世界模型(例如 HY-WorldPlay)以适应新的数据分布、训练方案和延迟目标。除了发布可运行的脚本、检查点、文档和推理代码之外,我们还提供了有关相机轨迹质量、可控性训练步骤和最小批量大小要求的实用消融。我们希望 minWM 成为构建和调整实时交互式视频世界模型的可复制和可扩展的方法。项目页面:[https://github.com/shengshu-ai/minWM](https://github.com/shengshu-ai/minWM)