论文
帧内几乎不动时保持JEPA世界模型可规划
Keeping JEPA World Models Plannable When Little of the Frame Moves
摘要
以语言而非目标帧指定目标是潜世界模型规划的自然接口,但测试它需要语言必须区分多个对象的场景。我们构建SLIM——带多个小物体、相同场景上配对视觉与语言目标的推动基准。SLIM上一个能解PushT的LeWM世界模型成功率不足1%,尽管带模拟器状态的脚本控制器能解开每个级别。探针把失败定位在编码器:其潜变量几乎动作不敏感——推杆与物体位置都无法从中解码,rollout不比复制当前潜变量好。一个施加于编码器潜变量与预测潜变量的逆动力学辅助损失(经测试时丢弃的共享头)恢复了所有探针,并把成功率从0.003提升到0.35(困难推动级0.16,目标无关策略为零),还改善了双倍训练地平线的PushT。对照把修复归因于进入编码器的梯度;响应扫描显示原模型在足够多的帧对动作有响应时即可规划。一个无需环境访问即可计算的廉价动作敏感度探针充当经验必要条件:阈值以下的所有配置都无法规划。在修复后的潜变量上,小型语言目标头无需重训世界模型即可从句子规划:导航达0.84(视觉目标oracle为1.00),命名区域与诱饵交换时仍跟随目标,并对未见名词优雅退化。单句目标很少完成推动,但把推动给为阶段句序列时,该头把中难级成功率从0.04提升到0.25——与目标帧oracle持平,且阶段切换仅从潜变量读取时同样成立。