论文
WorldCycle:长程视频世界模型的自验证强化学习
WorldCycle: Self-Verifiable Reinforcement Learning for Long-Horizon Video World Models
摘要
交互式视频世界模型对于长期规划和探索至关重要,但它们受到累积误差的影响。后训练方法如强化学习(RL)可以改善这些模型,但它们面临一个验证瓶颈:对于任意的动作序列,没有地面真值的未来状态存在来测量长期偏差。我们的关键洞察是可逆动作循环使得这种验证成为可能:由其逆动作组成的序列必须分析地返回到初始状态,从而在无监督标注的情况下对长期正确性进行诊断。基于这一点,我们引入了WorldCycle,这是一种自验证的RL框架,从普通的动作序列中构建闭合的动作循环及其重复执行,并优化两个互补的奖励:一个空间闭合奖励,确保镜像前半段和后半段之间的对称性,以及一个时间一致性奖励,使状态在重复循环执行之间保持一致。这些奖励迫使模型将动作学习成一致的状态操作者而不是记忆化的时序模式,从而扩展到基础模型处理不佳的跨分布复合动作循环。我们进一步公开了CycleBench,这是一个诊断基准,用于在复杂动作结构下返回状态的能力。WorldCycle通过减少44%的状态返回偏差和提升复合动作精度近4倍,为物理世界模型提供了坚实的基础。
