论文
WorldAlign:为世界一致的视频生成提供解耦的 4D 奖励
WorldAlign: Decoupled 4D Reward for World-Consistent Video Generation
摘要
忠实的视觉世界模拟需要生成的视频保持 4D 世界的一致性,包括静态和动态一致性。静态一致性要求静态环境中跨视点的连贯 3D 结构,而动态一致性则要求主体运动合理且外观随时间一致。几何感知后训练提供了一种提高世界一致性的有前途的方法。然而,现有方法通常依赖于静态场景假设。即使那些适应动态场景的系统也很难提供可靠的静态一致性反馈,而动态一致性常常被忽视或评估不充分。为了解决这些限制,我们引入了 WorldAlign,这是一个解耦的 4D 奖励框架,它在语义上分离静态区域和动态主题,并通过将每个区域与适合其假设的先验世界对齐来提供反馈。对于静态区域,WorldAlign 通过语义引导的掩模重投影将静态几何与几何世界先验对齐,从而实现更可靠的静态一致性评估;一个辅助的 相机运动奖励不鼓励近乎静态的解决方案。对于动态主题,WorldAlign 使用强大的视觉语言模型 (VLM) 作为动态世界先验,并根据评估动态性、物理合理性、形状和纹理一致性的特定样本检查表构建 VLM 作为法官奖励。这种解耦设计可以实现更有效的在线后期训练,而无需人类偏好注释。在两个预训练的图像到视频生成器 Wan2.1 和 Wan2.2 中,WorldAlign 共同提高了现有方法的静态和动态一致性,而无需抑制整体或主体运动。这些结果支持解耦的世界先验对齐,以实现更忠实的视觉世界模拟。项目页面:https://worldalign.github.io/.