论文

引导世界:通过合成人体摄像机控制快速生成自回归视频

Directing the World: Fast Autoregressive Video Generation with Compositional Human-Camera Control

应用与实践内容创作

摘要

构建交互式世界模型需要生成逼真的视频,同时保持长期的可控动​​态。自回归视频生成提供了可扩展的基础,但在长序列生成过程中会遇到错误积累和时间退化的问题。在人体运动和相机轨迹等异构控制下,这个问题会进一步放大,这可能会干扰预先训练的视频并使其不稳定,而现有方法通常会在可控性和视觉质量之间进行权衡。我们提出了“引导世界”,这是一种快速自回归框架,用于通过合成人体运动和摄像机轨迹控制来生成可控世界模型视频。我们的关键思想是解耦控制学习,同时保留统一的自回归视频先验。我们引入了快慢记忆训练策略来稳定长期轨迹生成学习并提高收敛性。对于人体运动控制,我们设计了一种t引导的动态投影机制和改进的Motion-CFG策略,在不降低视觉保真度的情况下实现时间平滑和精确的运动对准,并支持多人控制。在学习了鲁棒的运动先验之后,我们引入了第二阶段的相机轨迹控制模块,以通过视点变化来合成人体动力学,以实现连贯的世界探索。我们进一步构建了一个具有同步视频、文本、人体运动和相机轨迹注释的大规模数据集,并组织成以运动为中心和以相机为中心的子集,以进行解耦训练。大量实验表明,长视距生成稳定,具有精确的可控性和高视觉质量。如需了解更多信息,请访问 https://whydahuzi.github.io/Directing-the-World.github.io/。