论文

MotiMotion:利用视觉推理生成运动控制视频

MotiMotion: Motion-Controlled Video Generation with Visual Reasoning

模型推理解码与生成控制

摘要

当前的运动控制图像到视频生成模型严格遵循用户提供的轨迹,这些轨迹通常稀疏、不精确且因果不完整。这种依赖常常会产生不自然或难以置信的结果,特别是由于忽略了次要因果后果。为了解决这个问题,我们引入了 MotiMotion,这是一种新颖的框架,它将运动控制重新表述为推理然后生成的问题。为了鼓励基于因果关系和常识一致的交互,我们利用 无需训练 视觉语言推理器来细化主要轨迹的图像空间坐标并产生可信的次要运动。为了进一步提高运动自然度,我们提出了一种可调节引导强度的置信感知控制方案,使模型能够紧密遵循高置信度计划,同时利用其内部生成先验纠正低置信度输入下的伪影。为了支持系统评估,我们策划了一个新的图像到视频基准 MotiBench,它由以交互为中心的场景组成,其中新事件由运动触发。基于 VLM 的评估和 MotiBench 上的人体研究都表明,MotiMotion 生成的视频具有更合理的对象行为和交互,并且比现有方法更受青睐。