论文
RigidBench:评估视频生成模型中的刚体物理
RigidBench: Evaluating Rigid-Body Physics in Video Generation Models
摘要
视频模型越来越多地用于预测场景中接下来会发生什么,但通常用于比较其输出的指标却很少说明预测对象是否正确移动。运动、几何、身份、背景稳定性和视觉相似性可能会独立失败,但全帧分数通常会将这些错误混合在一起。我们引入了 RigidBench,这是一个基于模拟器的基准测试,它将生成的延续与来自相同初始帧和运动描述的参考卷展进行比较。它的五个刚体任务会改变对象、材质、视点以及室内和室外场景,并提供每帧遮罩、深度、6-DoF 轨迹和可用于评分的接触点。我们在相同的 100 个示例上评估了 8 个模型,并通过 10 项测量将这些方面分开。由此产生的排名在很大程度上取决于测量的内容:没有一个模型在所有 10 个模型中都处于领先地位,并且在所有模型均值中,较高的 SSIM 伴随着较大的 3D 轨迹误差 (r = 0.89)。 RigidBench 还包括 5,000 个具有精确模拟器状态的训练视频,我们用它来微调和分析 Wan 2.2 TI2V-5B。完整的 微调 将 3D 轨迹误差减少了约 20%,而 SSIM 几乎没有变化,而教师强制探测和有针对性的干预表明,对象位置在整个 Wan 扩散 Transformer 中得到体现,并用于其去噪计算。