论文

几何如何输入生成的运动?

How Does Geometry Enter Generated Motion?

模型评测模型行为与机制分析

摘要

在固定的物理定律下,场景的可见几何形状决定了运动必须如何改变。我们问视频生成器如何实现这种关系。我们修复了定律和初始状态,仅更改第一帧中绘制的几何图形,在匹配的轨道和偏转器族内,并将每个生成的轨迹与该几何图形的模拟器预测进行比较。配对干预每次改变一件事:局部碰撞、障碍物的高度、提示的文字、剪辑的长度。在九个图像到视频模型中,几何形状被保留并塑造运动:球的速度遵循轨迹的绘制波动。物理状态将推动这种响应,这里产生的运动脱离了定律。平均坡度几乎不会加速球,连续的接触无法通过一致的状态进行组合,球到达之前的编辑会改变其运动,并且球会爬过高于其释放点的障碍物。两个全局条件组织了全局轨迹:文本强烈控制目的地,而剪辑长度强烈控制测试的开放权重模型中的时间。该模式在拍摄的第一帧中仍然存在。因此,当前的视频生成表现为几何条件运动合成,其状态演化与固定物理定律的演化系统地不同。

几何如何输入生成的运动?的原论文方法或结果图
图 1:相同的定律,不同的几何形状。一球一法,一起点;仅障碍物的高度发生变化。在模拟运动中(上),球穿过较低的障碍物,并在高于其释放高度(虚线)的障碍物处折回。在生成的运动中(底部;MiniMax-H3,一颗种子),它会穿过两者,就像对待每个种子一样。