论文

事件边界的前瞻:评估视频世界模型中的物理预测

Foresight at the Event Boundary: Evaluating Physical Prediction in Video World Models

模型评测模型能力评测

摘要

视频世界模型在很大程度上被视为物理世界的预测模型,因此有望预测观察到的事件的后果。然而,评估主要集中在参考相似性、物理定律一致性或判断合理性上,仅间接估计预期。我们直接解决这个问题:当释放或影响刚刚发生但其后果被隐瞒时,世界模型能否预测接下来会发生什么?我们引入了基于 62 个受控现实世界自由落体记录和跨越三种对象类型的 124 个剪辑的事件锚定评估,并具有细粒度的释放和影响注释以及地面实况轨迹。该协议将结果产生、时间放置和物理实现分开。在六种当代视频生成和世界模型中,Runway 和 Veo 产生释放和后续影响事件的比率超过 93%,但通常启动时间很晚,而 Cosmos-Predict-2.5 和 MAGI-1 经常保留事件前的状态,并且产生很少或没有可测量的后果。在可测量的跌倒中,合理的时间并不一定意味着物理上一致的运动。我们进一步进行了一项 15 名参与者、20 种条件的人体研究,参与者描述单个事件锚定框架的预期结果并绘制其轨迹。人类的预测总体上有利于记录下来的未来,同时揭示了看似合理的延续之间真正的模糊性。总体而言,物理预见表现为一系列不同的挑战:引发结果、及时锚定它并实现其运动。