论文

MotionGrounder:基于扩散Transformer的多对象运动迁移与目标对齐

MotionGrounder: Grounded Multi-Object Motion Transfer via Diffusion Transformer

应用与实践内容创作

摘要

运动传输通过传输参考视频的时间动态来合成以目标字幕为条件的新视频,从而实现可控视频生成。然而,现有的基于 Diffusion Transformer (DiT) 的方法仅限于单对象视频,限制了具有多个对象的现实场景中的细粒度控制。在这项工作中,我们引入了 MotionGrounder,一个基于 DiT 的框架,它首先处理具有多对象可控性的运动传递。 MotionGrounder 中基于流的运动信号 (FMS) 为目标视频生成提供了稳定的运动先验,而我们的对象描述对齐损失 (OCAL) 将对象描述对齐到其相应的空间区域。我们进一步提出了一种新的对象定位对齐分数(OGS),它联合评估(i)源视频对象与其生成的对应对象之间的空间对齐以及(ii)每个生成的对象与其目标描述之间的语义一致性。我们的实验表明,MotionGrounder 在定量、定性和人类评估方面始终优于最新基线。