论文
跟踪不等于恒存:视频世界模型如何保留隐藏对象
Tracking Is Not Permanence: What Video World Models Keep of a Hidden Object
摘要
视频世界模型跟踪他们可以看到的物体;我们询问他们保留了哪些他们不能保留的物品。我们从冻结的 V-JEPA 2 预测器中隐藏一个对象,并将其对隐藏区域的预测与编码器对仅在该区域内部不同的两个世界的表示进行比较。预测器的决定是部分保留静止物体,而根本不保留容器内的物体,并在 0.3 秒内丢失一个移动物体(在 V-JEPA 自己的管掩码下为 0.5 秒;ViT-H 在预训练的 90% 掩蔽率下将其保持为 1.1 秒);在投影中,轨迹保留在中点下方,为复制最后一个视图的基线所保留的 14-60%。信息就在那里:编码器在 1.00 读取对象的存在,并保持封闭容器的内容可解码 3.5 秒,而使用编码器自己的 探针 读取的预测器输出,一旦盒子关闭半秒,就会在 2% 的场景中包含球。在渲染场景中,预测器方面缺少持久性,而训练可以像先验一样廉价地安装它:在合成容器上进行 3000 个仅预测器步骤,与两个匹配的控件相比,将这种信念从 0.05 变为 1.00。他们还将 IntPhys-2019 从 84.2% 提高到 93.3%,但没有容器的课程也是如此,训练习惯的基准学分会随着评分规则的变化而变化。带有管罩的连续训练在操作和互联网风格视频上产生 1.1-1.6 秒的运动物体残留,因此缺陷不是潜在预测所固有的。 VideoMAE 几乎什么都没有保留,而 Cosmos 的下一个 token 预测保留了一个静止的隐藏物体,但没有保留在移动容器内的物体。
