下一个强迫:具有多块预测的因果世界建模
Next Forcing: Causal World Modeling with Multi-Chunk Prediction
摘要
自回归视频生成已成为世界行动模型 (WAM) 的强大范例。然而,现有方法存在训练收敛速度慢和收敛精度有限的问题,特别是在高帧速率下,因为训练监督仅限于当前块,没有关于未来动态的明确信号;由于迭代视频去噪,它们还面临推理缓慢的问题。在本文中,我们提出了 Next Forcing,这是一种用于因果世界建模的多块预测 (MCP) 框架,可实现更快的训练、更高的准确性和加速的推理。受 大语言模型 中多词元预测的启发,Next Forcing 引入了 MCP 训练目标,该目标通过轻量级辅助 MCP 模块增强主模型,以同时对多个未来时间范围内的视频块(next$^1$、next$^2$、next$^3$ 块)进行去噪。这些 MCP 模块形成了跨预测深度的因果链,其中利用主模型多层融合的中间特征来预测未来动态,允许近期预测为更远未来的预测提供信息,并向主模型提供密集的多尺度时间监督。在训练过程中,MCP 模块显着加速收敛并提高收敛精度,尤其是在高帧速率下:在 50 fps 下,Next Forcing 在 5k 训练步数下比 LingBot-VA 实现了 93.1% 的相对改进,收敛速度提高了 2.3 倍,并在 RoboTwin 基准测试中建立了新的最先进结果(Clean/Random 上为 94.1/93.5%)。在推理时,可以保留 MCP 模块来与当前视频块并行预测下一个视频块,从而实现 2 倍的推理加速。 Next Forcing 还展示了 PhyWorld(评估视频生成中物理定律遵守情况的基准)的显着改进,以及一般视频预训练的 FVD 减少了 50% 以上。