论文
假设世界:具体场景中一般世界模型的因果基准
What-If World: A Causal Benchmark for General World Models in Embodied Scenarios
摘要
视频生成模型越来越多地用作驾驶和机器人操作等任务的世界模拟器。在这些设置中,重要的不是单个视频看起来是否正确,而是当输入发生变化时模型的输出是否会发生变化。我们通过向模型提供两个提示描述同一场景(其中一个物理细节有所不同)来测试这一点,并检查两个视频是否与物理预测的方式存在差异。提示之间的措辞差异在设计上很小,因为只更改了一个变量,但正确的物理差异却没有。错过这一点的模型仍然可以生成两个视频,每个视频看起来都很合理,而现有的基准测试一次对一个视频进行评分,无法检测到这种失败。我们引入了 What-If World,319 个这样的提示对构建在 nuScenes 和 DROID 的真实框架上,按照驾驶和操作过程中共享的六个物理变量的分类法进行组织。每对都用 APEO 进行评分,这是一个由四部分组成的评分标准,检查每个视频是否遵循其提示(遵守)、物理一致(物理)、保留共享场景(环境),并以正确的差异结束(结果)。在 9 个最先进的模型中,没有系统的配对分数超过 52%,开源模型集群接近 28%。每个测试的模型在很大一部分因果干预上都失败了,这表明这些模型在可靠地支持行动条件模拟或基于模型的规划之前还有很大的空间。在模型得分较高的情况下,性能似乎会跟踪干预的视觉突出性,而不是其基础物理的易处理性。一些视觉上微妙的干预措施得分低至 14.2%,而视觉上明显的干预措施得分高达 40.4%。