论文
潜在世界模型中的干预差距
The Intervention Gap in Latent World Models
摘要
规划时间干预保真度是学习世界模型的一个独特的、可测量的属性:模型自身的开环转换是否以匹配的环境干预的方式移动任务变量。在我们测试的设置中,它既不是通过奖励匹配来揭示的,也不是通过任务锚定训练来保证的。在已发布的 TD-MPC2 检查点大小中,随着对任务可观察量的算子错误诊断的增长,事件回报率下降,而奖励预测误差保持较小且几乎持平,并且在没有任务信号的情况下训练的自监督世界模型比共享任务上的任务锚定模型更好地保留了相同的算子。然后,捕获门控匹配干预审计可以定位失败的地方。在Cheetah上,三个LeWorldModel检查点捕获当前任务查询并支持可解码的真实干预效果;然而,他们想象的五步效应比预测没有效果更糟糕,比环境端点预言更糟糕。失败是任务方向轮换带来的额外增益,而不是功能崩溃。这种严重的模式是有条件的:五个 PreJEPA 种子在没有它的情况下保留了与预言机相关的缺陷,Finger Spin 实验将缺陷扩展到了运动之外,种子之间的严重程度不同,共享库效应几何形状既依赖于候选者又依赖于支持。我们还测试练习方面的问题。在 DreamerV3 中,后验分布(而不是其样本)承载当前查询;集成分歧仅在训练支持附近排名错误;冻结的支持感知分数会降低两个测试传输方向上的保留错误排名,而本机分歧在这两个方向上仍然提供信息。我们的结论是,必须在模型的本机界面上直接审核干预保真度,首先捕获。