论文

Qantara:多范式 JEPA 控制的桥流训练

Qantara: Bridge-Flow Training for Multi-Paradigm JEPA Control

模型架构新型架构

摘要

联合嵌入预测架构 (JEPA) 支持越来越多的潜在世界模型家族,用于通过原始像素进行控制,但每个现有的 JEPA 世界模型在训练时都致力于单一推理范式:要么在学习动态模型中进行轨迹优化,要么直接行为克隆。当部署约束(轨迹展开成本、观察可访问性)决定哪条路径获胜时,为两者提供服务的单个检查点会将这种选择推迟到推理。我们提出了 Qantara,一种端到端的 JEPA,其联合训练目标将状态轴上的连续干净潜在变量与动作轴上的噪声到数据流匹配之间的布朗桥插值配对。同一检查点无需重新训练即可服务于三种推理范式:潜在规划、行为克隆动作采样和逆动态,我们通过视频逆合成进行查询,该合成首先在没有动作条件的情况下预测下一个潜在,然后提取动作。训练将质量集中在(动作时间、状态时间)噪声方块的边缘,其中推理查询预测器:用均匀内部采样替换它,将匹配计算时的 Push-T 规划从 90.1 SR 降低到 53.3 SR。在 LeWM 控制套件上,Qantara 达到了 91.2 SR 三训练种子平均值,并在 OGBench-Cube 上设置了新的 SOTA(比 DINO-WM + 7.7 SR,比 LeWM + 19.7)。在相同的权重下,行为克隆和视频逆路径在 Push-T 上达到 82-83 SR,在 Cube 上达到 71-73 SR。这些结果将 JEPA 世界模型从单范式规划器转移到多范式控制器。