论文

以实体为中心的世界模型:用于因果视频预测的交互感知屏蔽

Entity-Centric World Models: Interaction-Aware Masking for Causal Video Prediction

模型训练预训练

摘要

从未标记的视频中学习预测世界模型是人工智能的基本挑战。虽然联合嵌入预测架构 (JEPA) 在语义分类方面设定了新的基准,但它们通常仍然是物理盲的,无法捕获下游推理所需的因果动态。我们假设这源于标准的基于补丁的掩蔽策略,该策略优先考虑视觉纹理而不是罕见但信息丰富的运动事件。我们提出了交互感知 JEPA (IA-JEPA),它利用自我监督的以运动为中心的掩蔽策略来优先考虑物理交互。通过专门针对参与碰撞或动量转移的实体,我们迫使架构重建潜在轨迹而不是静态背景特征。根据 CLEVRER 基准评估,IA-JEPA 在因果推理任务上实现了 14.26% 的准确率,显着领先于标准补丁屏蔽基线所实现的 3.22%。至关重要的是,我们证明 IA-JEPA 通过引入更高熵、更具辨别力的潜在空间(+10% 熵增益)来线性化物理能量($R^2=0.43$),从而打破了标准自我监督的“静态偏差”。我们证明这种交互偏差可以推广到现实世界的人类行为 (Something-Something V2) 和零样本物理谜题 (PHYRE-Lite)。我们的结果为构建基础世界模型提供了一条可扩展的、完全自我监督的路径,这些模型开始内化物理世界的因果结构。