论文

语言条件视觉导航的政策引导世界模型规划

Policy-Guided World Model Planning for Language-Conditioned Visual Navigation

摘要

在给定自然语言指令的情况下导航到视觉上指定的目标仍然是具身AI的基本挑战。现有的方法要么依赖于与长期规划作斗争的反应性策略,要么采用在高维空间中遭受不良动作初始化的世界模型。我们提出了 PiJEPA,这是一个两阶段框架,它将学习导航策略的优势与指令条件视觉导航的潜在世界模型规划结合起来。在第一阶段,我们在 CAST 导航数据集上微调基于 Octo 的通才策略,并使用冻结的预训练视觉编码器(DINOv2 或 V-JEPA-2)进行增强,以生成基于当前观察和语言指令的知情动作分布。在第二阶段,我们使用这种策略派生分布在单独训练的 JEPA 世界模型上热启动模型预测路径积分 (MPPI) 规划,该模型预测同一冻结编码器的嵌入空间中的未来潜在状态。通过从策略先验而不是从不知情的高斯初始化 MPPI 采样分布,我们的规划器可以更快地收敛到达到目标的高质量动作序列。我们系统地研究了视觉编码器主干的影响,在政策和世界模型组件中比较了 DINOv2 和 V-JEPA-2。现实世界导航任务的实验表明,PiJEPA 的性能显着优于独立策略执行和无信息世界模型规划,从而提高了目标达成的准确性和指令遵循的保真度。