论文
MechVerse:评估视频生成模型中的物理运动一致性
MechVerse: Evaluating Physical Motion Consistency in Video Generation Models
摘要
文本和图像条件视频生成模型已经实现了强大的视觉保真度和时间连贯性,但它们通常无法生成受运动学和几何约束控制的运动。在这些设置中,对象部件必须保持刚性,与相邻部件保持接触或耦合,并在连接的部件之间一致地传递运动。这些要求在铰接式机械组件中尤其明确,其中运动受到刚性连接几何形状、接触/耦合关系以及通过运动链的传输的约束。因此,生成的视频可能看似合理,但违反了预期的机制,例如旋转应平移的部件、使刚性部件变形、破坏部件之间的耦合或无法移动下游部件。为了评估这一差距,我们引入了 MechVerse,这是机械一致的图像到视频生成的基准。 MechVerse 包含来自 141 个类别的 1,357 个机械组件的 21,156 个合成夹子,分为运动复杂性不断增加的三层:独立铰接、成对耦合和密集耦合的多部件机构。每个剪辑都配有结构化提示,描述零件标识、固定支撑、移动组件、运动基元、方向、速度/范围以及零件间依赖性。我们使用标准视频指标、指令跟踪分数以及人类对运动正确性和运动学耦合的判断来评估专有、开源和微调的图像到视频模型。结果表明,当前模型可以保持外观和平滑度,但无法生成机械上允许的运动,并且误差随着耦合复杂性的增加而增加。 MechVerse 提供了一个基准,用于测量和改进从图像和语言输入生成机制感知视频。