论文
Do-JEPA:从隐藏到干预潜在世界模型
Do-JEPA: From Masking to Intervention in Latent World Models
摘要
潜在世界模型经过训练可以预测接下来会发生什么,因此它们的目标中没有任何内容可以将某个动作引起的结果与仅与其同时发生的结果区分开来。诸如 C-JEPA 之类的对象屏蔽模型会干预预测者可以看到的内容;我们干预实际发生的事情。从一个保存的模拟器状态,我们在动作 $a$ 和参考动作 $a_{\varnothing}$ 下运行动态,并训练模型来预测两个潜在未来之间的差异 $Δz=z^{a}-z^{a_{\varnothing}}$。由此产生的目标 Do-JEPA 具有效果损失、支持损失(动作进入的地方)、传播损失(效果传播的地方)和不变性损失(不得改变的东西)。在具有对象对齐变量的合成系统中,支持监督在 99.95% 的测试用例中找到直接干预的对象,其中稀疏动作掩码在每种情况下都会将动作发送到滋扰槽,响应起始监督恢复环形传播图(边缘 AUROC 0.975 与 0.624)。从像素来看,效果损失击败了在完全相同的数据上训练的控制:它在端到端 LeWM 模型上将潜在效果误差降低了 28.4%,在自然动作序列上训练和测试时将物理效果误差降低了 13.5%,并且在三个独立生成的 CausalWorld 基准上,它在物理变化下将响应效果误差降低了约 20%,将预测效果的潜在上下文敏感性降低了 66%。从头开始训练会损害事实的准确性;用它对现有模型进行微调可以消除这种成本。总之,这些结果表明,对世界进行干预,而不是对模型所看到的进行干预,有助于潜在世界模型预测其行为会导致什么。