论文
是什么使视频世界模型潜在与动作相关:预测重建
What Makes Video World Model Latents Action-Relevant: Prediction over Reconstruction
摘要
视频世界模型越来越多地用于提供预测视觉表示,但仍不清楚哪些预训练信号在其潜在空间中诱导与动作相关的结构。我们通过跨不同编码器系列的统一的基于探针的评估来研究这个问题,包括仅图像自监督、带或不带潜在预测的视频预训练、基于重建的自动编码器、扩散模型和捷径强制动力学模型。使用常见的逆动态探测目标,我们发现动作相关结构主要由时间视频预训练驱动,而不是像素重建保真度:具有强大像素解码质量的模型可以表现出接近零的动作可恢复性,而视频预训练的自监督编码器始终在视觉保真度和动作预测之间实现最佳帕累托权衡。比较 V-JEPA 和 VideoMAE 进一步表明,大多数收益来自自然视频时间上下文,而特征级潜在预测提供的额外收益较小。尽管卡尔文揭示静态环境任务可以通过允许强大的图像先验就足够,从而部分掩盖时间结构的重要性,但这些趋势在机器人基准上转移。最后,逆动态监督极大地提高了对视觉损坏的鲁棒性,这表明动作感知目标规范了潜在的几何形状,超出了干净设置的性能。我们的结果将时间预测结构(而不是重建保真度)确定为动作相关视频表示的主要成分。