论文

AVL-JEPA:防止JEPA世界模型的因果动力学信息坍缩

AVL-JEPA: Preventing Causal Dynamics Information Collapse In Joint Embedding Predictive Architecture World Models

模型架构新型架构

摘要

联合嵌入预测架构(JEPA)在不重建观测的情况下预测未来潜表示,使世界模型聚焦高层语义动力学。但JEPA可能在保留高维视觉信息的同时丢弃动作的物理后果信息。我们把这种失败模式称为因果动力学信息坍缩,并提出动作接地的视觉不变潜表示(AVL)来防止:先用执行动作作为辅助动力学锚,鼓励模型保留动力学信息;再用视觉不变通路——在不丢弃动力学信息的前提下对齐扰动与干净的潜预测,迫使模型充分理解并利用因果动力学信息。我们在四个机器人控制任务(TwoRoom、PushT、OGBench Cube与Reacher)上验证AVL:视觉扰动下成功率大幅提升且保持干净环境性能;进一步评估物理后果对齐、干净-噪声动力学一致性及定向转移子空间擦除的因果效应。总体上结果表明:与规划因果相关的动力学信息在AVL下免于坍缩。