论文
视频基础模型如何编码直观的物理?探索预训练范式
How Do Video Foundation Models Encode Intuitive Physics? Probing Across Pretraining Paradigms
摘要
我们研究预训练的视频基础模型是否在其冻结表示中编码直观物理信息,以及这些信息如何在模型系列、层和探针类型之间变化。我们使用 IntPhys2 和最小视频对 (MVP) 上的冻结特征探测,比较了预测联合嵌入模型 (V-JEPA)、掩模重建模型 (VideoMAE) 和基于扩散的视频生成器 (LTX-Video)。 V-JEPA 在各个基准测试中取得了最强的整体结果,尤其是使用模拟时间动态的探针,而 VideoMAE 仍然具有竞争力,LTX-Video 恢复了较弱但重要的信号。分层分析表明,物理相关信息在早期层中最弱,而在中后期深度最容易访问,而时间控制表明,破坏帧顺序会大大降低性能,尤其是在 MVP 上。总之,这些结果表明直观物理知识在预训练的视频表示中可靠地出现,但其可访问性在很大程度上取决于预训练范式、表示深度和读出机制。