论文

CoMoGen:可控制的运动动力学和与掩模引导视频生成的交互

CoMoGen: COntrollable MOtion Dynamics and Interactions with Mask-Guided Video GENeration

模型训练参数高效训练

摘要

我们提出了 CoMoGen,这是一种可控视频生成框架,它可以根据输入图像的单个二进制掩模序列生成逼真的交互式动态。 CoMoGen 推出了一种轻量级 MaskAdapter,可将二进制掩模序列编码为潜在残差信号,并通过余弦加权调度注入多模态扩散 Transformer (MMDiT) 模型。与 UNet 架构的从粗到精的分层设计不同,MMDiT 作为一系列统一的 Transformer 块进行操作,因此很难识别哪些层负责运动生成。因此,我们提出了一种新的方法来确定在 MMDiT 的注意力空间中运行的“运动层”。我们通过对运动层使用低秩适应 (LoRA) 来微调模型,而不需要 MMDiT 中的任何架构更改。这种选择性的适应使我们的方法能够专注于运动关键组件,从而降低计算成本。尽管它很简单,但 CoMoGen 可以实现精确的主体运动以及与周围人类、物体和场景的合理交互。对不同数据集的综合实验表明,CoMoGen 始终优于现有的可控视频生成方法,并在运动保真度和感知真实感方面实现了最先进的性能。项目页面:mericadil.github.io/CoMoGen。