论文

OmniCamera:具有任意相机控制的多任务视频生成的统一框架

OmniCamera: A Unified Framework for Multi-task Video Generation with Arbitrary Camera Control

模型训练合成数据

摘要

视频从根本上将两个关键轴交织在一起:场景的动态内容和观察场景的摄像机运动。然而,现有的生成模型常常将这些因素纠缠在一起,限制了独立控制。在这项工作中,我们介绍了 OmniCamera,这是一个统一的框架,旨在明确地解开和控制这两个维度。这种合成方法通过允许摄像机和内容条件的任意配对来实现灵活的视频生成,从而解锁前所未有的创意控制。为了克服此类系统固有的模态冲突和数据稀缺的根本挑战,我们提出了两项​​关键创新。首先,我们构建了 OmniCAM,这是一个新颖的混合数据集,将精选的真实世界视频与合成数据相结合,为稳健的多任务学习提供了多样化的配对示例。其次,我们提出了一种双层课程协同训练策略,可以减轻模态干扰并从不同的数据源中协同学习。该策略在两个层面上运作:首先,它根据困难逐步引入控制方式(条件级),其次,在适应真实数据以达到真实感(数据级)之前训练对合成数据的精确控制。因此,OmniCamera 实现了最先进的性能,能够灵活控制复杂的相机运动,同时保持卓越的视觉质量。