论文

FactorJEPA:把复杂城市世界的整体未来拆分为布局、Agent与交互通道

FactorJEPA: Factorizing Monolithic Futures into Layout-Agent-Interaction Channels for Crowded and Chaotic Global South Urban Worlds

模型架构新型架构

摘要

世界模型因其捕获和预测物理世界结构和动态的能力而备受关注。在这一新兴领域中,联合嵌入预测架构(JEPA)提供了一个特别引人注目的方向。我们研究了一个相对未被探索的领域:人口密集、拥挤且混沌的全球南方城市环境,我们称之为DENSEWORLD。与现有评估中主导的低密度、车道结构化设置不同,这些场景表现出软空间边界、极端的代理异质性、持续的遮挡和混合交通下的快速社会谈判。我们引入了一个大规模数据集,用于这个领域:22个城市中的1,000小时的驾驶、步行和空中视频。现有的JEPA形式化在异质性和部分可观测性下难以保留密集的交互动态。我们引入了FactorJEPA,使世界结构成为第一个级的预测基础。与编码未来在单一潜空间中不同,它通过可见性门和分离的子空间来组合布局、实体和互动,以保留部分观察的代理并防止跨因子捷径。FactorJEPA在(i)未来潜空间精度(Future-frame L1)、(ii)干预敏感的预测(Causal L1)和(iii)视觉证据减少的鲁棒性(Mask-ratio slope)方面改进,同时暴露(iv)可重复的运动信息权衡(Motion cosine)。方法排名在2B和1B V-JEPA 2.1后端上保持一致,rho值为0.895到0.978。我们公开发布了DENSEWORLD-115k数据集(https://huggingface.co/datasets/anonymousML123/denseworld-115k)和手术训练后的FactorJEPA检查点(https://huggingface.co/datasets/anonymousML123/factorjepa-outputs/tree/main/outputs/full/vjepa_2_1_vitg_1B/train/m09c_surgery_3stage_DI_diheavy_encoder)。

FactorJEPA:把复杂城市世界的整体未来拆分为布局、Agent与交互通道:论文配图
图1:同一个问题、两种编码器。每行展示一个留出视频片段的三帧画面,并以多选题形式提问;对冻结的 V-JEPA 2.1 编码器和本文经因子视角预测器改造的编码器使用相同探测头作答,差别仅在主干网络。上:运动速度,本文方法为69.8%,冻结模型为60.9%;下:转弯方向。