论文
World-R1:加强文本转视频生成的 3D 约束
World-R1: Reinforcing 3D Constraints for Text-to-Video Generation
摘要
最近的视频基础模型展示了令人印象深刻的视觉合成,但经常遇到几何不一致的问题。虽然现有方法尝试通过架构修改注入 3D 先验,但它们通常会产生高昂的计算成本并限制可扩展性。我们提出了 World-R1,一个通过强化学习使视频生成与 3D 约束保持一致的框架。为了促进这种对齐,我们引入了专门为世界模拟量身定制的纯文本数据集。利用 Flow-GRPO,我们利用来自预训练 3D 基础模型和视觉语言模型的反馈来优化模型,以在不改变底层架构的情况下增强结构一致性。我们进一步采用周期性解耦训练策略来平衡刚性几何一致性和动态场景流动性。广泛的评估表明,我们的方法显着增强了 3D 一致性,同时保留了基础模型的原始视觉质量,有效地弥合了视频生成和可扩展世界模拟之间的差距。