论文

当前的世界模型缺乏持久状态核心

Current World Models Lack a Persistent State Core

模型评测基准与评测资源

摘要

世界模型越来越被认为是迈向通用人工智能的决定性一步,然而,对物理世界进行建模需要的不仅仅是按需渲染令人信服的框架:它需要一个随着时间的推移不断演变的内部世界状态,与观察脱钩,以便无论相机是否在观察,物体都能持续存在,事件也会得出结论,就像月球在无人注视时保持其轨道一样。这一要求是现有基准的盲点,现有基准奖励保真度、运动和相机可控性等表面属性,而从不询问生成的世界在不被观察到的情况下是否会不断发展。我们引入了 \textbf{WRBench},这是第一个系统诊断基准,它将相机运动视为对可观察性的干预,并将评估解析为人类校准的链,询问相机是否执行所请求的交互,场景在视图中是否保持连续和可识别,以及返回的目标是否与设置的运动事件保持一致。在跨越四种控制范式的 23 个模型的 9{,}600 个视频中,一个发现被证明是顽固的:当前的系统将观察到的世界保持为跟踪镜头,恢复目标被放弃的状态,而不是在事件消失时推进事件。因为这种失败在控制范式、模型族和规模增量中反复出现,所以鲁棒的世界状态演化并不是从更清晰的图像、更严格的控制、更丰富的几何先验或纯粹的参数计数中得出的,因此我们认为,物理状态内核的稳定性和视点干预下世界线的一致性应该成为世界模型设计的首要目标,以便世界模型捕获世界将如何展开,而不是下一帧如何出现。