论文
世界建模的潜在视频预测:一项评估揭示了有趣的有利证据
Latent Video Prediction for World Modeling: An Evaluation Uncovering Intriguing Favorable Evidence
摘要
自监督视频模型越来越多地被视为世界模型,但它们仍然几乎完全在干净的视频上进行评估并报告为最终任务分数,从而模糊了它们的表示在部署的世界模型必须处理的退化和模糊条件下的表现。我们提出了该组件的首次系统研究,分析了四种能力匹配的前沿自监督学习模型,它们是世界模型编码器的有力候选者 - V-JEPA 2.1、V-JEPA 2、VideoPrism 和 VideoMAEv2 - 跨越与其作为视频世界模型部署相关的五个鲁棒性轴:特征辨别性、损坏鲁棒性、细粒度辨别、遮挡鲁棒性和对时间方向的敏感性。我们在 Something-Something-v2 上运行研究,并重复在以自我为中心的 EGTEA Gaze+ 上移植的每个轴,其中模型排序保持不变。我们的结果揭示了所有五个轴上的潜在预测模型的独特且一致的概况。它们在像素损坏的情况下更加优雅地退化,在遮挡下保留可用的类结构而不仅仅是几何稳定性,捕获细粒度的物理接触线索而不重建像素,并对时间之箭进行独特的编码。最后,我们测试这些表示级别差异对于下游世界建模是否重要,在模拟操作环境中将每个冻结编码器与相同的动作条件预测器和规划器配对。只有潜在预测才能产生接近完成的任务成功,在退化的观察下仍然有效,并转移到预测器从未接受过训练的操作任务。我们的结果提供了具体的新证据,表明潜在预测是稳健世界建模的有希望的基础。