论文

冻结在框架中:JEPA 世界模型中的速度盲点

Frozen in a Frame: The Velocity Blind Spot in JEPA World Models

模型评测模型行为与机制分析

摘要

用于世界建模的联合嵌入预测架构 (JEPA) 训练编码器,以便预测器始终从单个渲染帧将当前嵌入和动作映射到下一帧的嵌入。这有一个结构盲点:没有运动模糊的渲染器仅从配置中绘制场景,因此对于任何编码器(包括官方发布的 LeWM 权重),单帧嵌入不携带速度信息。我们在官方检查点的四个真实基准测试(PushT、Reacher、Cube、TwoRoom)上确认了这一点:每个线速度探针都等于或低于随机水平,而位置探针达到 R^2 约 0.95。我们引入了 RateIdent(一种三阶段诊断协议)和 TI-JEPA(一种轻量级修复程序),将潜在数据分割为姿势代码和显式有限差分运动代码,并进行联合预测。在三个物理视觉定位环境中,TI-JEPA 在匹配的记忆基线(例如Pendulum 上的最终距离缩短了 55% (p=3.2x10^-10),CartPole 上的最终距离缩短了 64% (p=5.1x10^-15)。我们以官方 ViT-Tiny 加 AdaLN-transformer 规模重现这一点,然后将相同的配方推到从头开始训练的真实 dm_control Reacher 照片上,其中 TI-JEPA 的分支分离超过记忆基线的大约 38 倍,这是论文的最大差距。与相同足迹的循环 RSSM 式预测器相比,TI-JEPA 在三种环境中的两种环境中匹配或超过了其执行轨迹精度,保持可单独探测姿势和运动,并在最耦合的环境中彻底获胜。可检查的正式参数和六个评估环境表明,当速度很重要时,单帧目标是错误的预测对象,并且一个小的、可解释的结构变化在没有特权监督的情况下修复了它。代码、检查点和项目页面链接在标题下方。

冻结在框架中:JEPA 世界模型中的速度盲点的原论文方法或结果图
图 1:证据链概览。答:探针 $r$ 用于 8 辐雷达上的速度、单帧基线与 TI-JEPA 的显式运动代码相比,跨越八个环境/尺度组合($\times$ 标记官方检查点,没有经过 $v$ 头部训练,而不是零)。 B:杀灭实验分枝分离率;条形高度是相对于地面实况的分离幅度(1.0 = 精确匹配),并且与每个条形上方注释的符号/方向精度无关。 C:在任务适定的三个环境中,相对于记忆匹配基线的闭环规划改进(真正的 PushT 在该任务上的空结果在正文中报告)。