论文
通过物理可控世界模型理解物理对象
Physical Object Understanding with a Physically Controllable World Model
摘要
视觉智能的一个核心挑战是从原始视频中学习场景的物理结构:区域如何形成物体以及控制它们相互作用的规律。解决这些任务需要世界模型能够从部分观察中推断出世界的分布状态——当前架构不提供这种能力。我们引入了一类新的概率世界模型,它支持以任何其他变量为条件的任何视觉变量(例如外观和动态)的概率估计。在这里,我们发现这些模型可以通过自回归序列建模进行有效训练,从而产生丰富的对象理解的世界模型。首先,我们证明我们的模型通过顺序推理生成多个可能的未来世界状态,从而捕获了控制物体如何移动的物理定律。然后,通过分析这些未来的运动相关性,我们提取对象和铰接对象的子部分。发现这些物体后,我们展示了我们的世界模型可以在 3D 中操纵它们。最后,我们演示了如何从世界模型计算对象之间的物理关系,从而支持 Visual Jenga 等应用程序。