论文
Astronex-World 1.0:可实时交互的可控视频世界模型
Astronex-World 1.0: Real-Time Interactive World Model Foundation
摘要
我们推出了 Astronex-World 1.0,一个开放的可控视频世界模型基础。给定文本提示(文本到视频)或初始观察(图像到视频),该模型可以预测帧对齐的相机轨迹、连续动作和实施例标识符下的未来视觉状态,并接受在卷展栏的指定位置插入的文本事件。该系列提供了用于全上下文生成的双向模型和具有块因果注意和跨块 KV 缓存的持久生成的因果模型,两者都建立在 Wan2.2-TI2V-5B 先验基础上。 PRoPE 注入相机内部和外部,而 64 维动作流则调制每个 Transformer 层。五阶段训练路径开发双向相机和动作控制,将主干转换为块因果生成,提取几个步骤的学生,恢复混合域动态,并应用非对称 DMD/DMD2 分布匹配。因果模型以 24 fps 生成 832x480 视频。所有五个训练阶段都在两个 NVIDIA L20 48 GB GPU 上运行,因果模型在其中一个 GPU 上实时传输。它在 WBench Navi 上的得分为 73.5,在 WBench Full 上的得分为 70.0。全面来看,这个 5B 模型高于 13.6B LongCat-Video 和 14B Helios,与 22B LTX-2.3 相差一分,并且高于 YUME 1.5,后者是在 NVIDIA A100 GPU 上从相同的 5B 之前进行后训练的。预留的动作输入和输出接口允许进行具身智能和自动驾驶的后期训练。