论文
DynaVid:学习使用合成运动数据生成高动态视频
DynaVid: Learning to Generate Highly Dynamic Videos using Synthetic Motion Data
摘要
尽管最近取得了进展,视频扩散模型仍然难以合成涉及高动态运动或需要细粒度运动可控性的逼真视频。一个主要限制在于常用训练数据集中此类示例的稀缺性。为了解决这个问题,我们引入了 DynaVid,这是一种视频合成框架,它在训练中利用合成运动数据,该数据表示为光流并使用计算机图形管道进行渲染。这种方法有两个关键优势。首先,合成运动提供了难以从真实数据中获得的多样化运动模式和精确控制信号。其次,与具有人工外观的渲染视频不同,渲染光流仅对运动进行编码,并与外观分离,从而防止模型再现合成视频的不自然外观。基于这个想法,DynaVid 采用了两阶段生成框架:运动生成器首先合成运动,然后运动引导视频生成器生成以该运动为条件的视频帧。这种解耦的公式使模型能够从合成数据中学习动态运动模式,同时保留真实世界视频的视觉真实感。我们在两个具有挑战性的场景(剧烈的人体运动生成和极端的相机运动控制)上验证了我们的框架,其中现有数据集特别有限。大量实验表明,DynaVid 提高了动态运动生成和相机运动控制的真实性和可控性。