论文

世界模型的物理期末考

World Models' Last Exam in Physics

模型评测基准与评测资源

摘要

视频世界模型可以产生视觉上令人信服但物理上不一致的序列,引发人们对其在具体人工智能系统中预测和规划的可靠性的担忧。现有的评估往往依赖于基于模型的判断或参考视频,而直接的物理测试主要侧重于力学。我们介绍了世界模型的物理学最后考试,这是一种基于测量的基准,用于评估视频世界模型中的物理一致性。该基准测试包括 40 项受控任务,涵盖力学、光学、流体、热和相变现象、电磁和表面张力。每个任务将初始图像和生成提示与预定义的物理标准配对,从而无需参考视频即可对可观察的物理关系进行可解释的测试。其评估器将任务可观察性筛选与特定任务的定量物理测量相结合。对 1,280 个视频中的 8 个视频生成模型进行的实验揭示了任务之间持续的物理不一致和显着变化,最佳模型的总体得分为 57.76(满分 100)。对具有已知物理关系的合成视频的评估为受控条件下测量模块的有效性提供了证据。在任务内排名和成对比较中,评估器还比直接视觉语言模型基线与人类判断达到了更高的一致性。通过将物理领域的覆盖范围与基于可测量证据和明确测量限制的分数相结合,该基准为诊断物理不一致和跟踪物理一致视频世界模型的进展提供了可解释的基础。

世界模型的物理期末考:论文原图
图 1:我们的基准测试概述。 (1) 基准范围:40 个受控任务涵盖九个物理类别,并由用于提取可观测量的感知工具支持。 (2) 生成协议:每个任务将生成的初始帧与特定于任务的视频提示配对,并在基准构建过程中进行细化。线圈和磁铁的场景说明了这个过程。 (3) 测量流程:一个单独的摆示例说明了一致性筛选、物理测量以及与预定义物理标准的比较。 (4) 总体性能:平均综合得分总结了九个类别中八个视频生成模型的性能。归一化综合分数乘以 100 进行演示,值越高表示性能越好。