论文

Juno:结合动作表征预训练与部署适配的机器人学习

Juno: Taming Predictive Latents for Vision-Language-Action Models

模型训练应用与实践预训练持续学习机器人

摘要

联合嵌入预测架构(JEPA)预测表示空间中的屏蔽或未来观察,为视觉语言动作(VLA)模型提供预测潜在的自然来源。然而,要使这些潜在变量在预训练、策略学习和部署中发挥作用,需要解决三个失败问题:与特定实施例的控制不匹配、对行动学习的干扰以及分布变化下教师的误校准。我们介绍 Juno,这是一个围绕一个动作条件 JEPA 构建的统一框架,它充当控制对齐的表示骨干、预测教师和适应性强的动态模型。在预训练期间,我们在与实施例匹配的轨迹上对其进行训练,并使用动态 CLS 损失将运动加权补丁动态传递到紧凑的全局状态。在策略学习过程中,我们将当前框架的 JEPA 补丁融合到 VLA 感知中,并使用具有单独转换参数的解耦推理分支来提取未来潜在状态以生成动作。在部署过程中,我们根据所有观察到的转变调整世界模型, 包括失败的Rollout、冻结适应的教师,以及使用 LoRA 适配器和可训练的行动头重新调整已验证执行的策略,而无需专家纠正或任务奖励。在 SimplerEnv 上,Juno 比最强基线 Qwen3GR00T 的平均成功率从 $60.9\%$ 提高到 $68.5\%$,测试时间适应进一步达到 $72.7\%$;在真实的机器人上,它在背景、高度和对象变化(基本策略崩溃到 $0\%$)下保持了 $70\%$--$75\%$ 的成功。

Juno:结合动作表征预训练与部署适配的机器人学习:论文原图
图 1:我们推出了 Juno,这是一个统一的框架,使预测潜伏在整个视觉-语言-动作 (VLA) 生命周期中发挥作用。 Juno 集成了控制对齐的 JEPA 预训练、视觉特征融合和解耦的未来潜在蒸馏,以及动态优先的测试时间适应,可在重新调整策略之前更新世界模型。它提高了 SimplerEnv 和 RoboCasa 的性能,并支持分布变化下强大的现实操作。