论文

基于模型规划的语言潜在目标预测

Latent Goal Prediction from Language for Model-Based Planning

智能体系统Agent 规划

摘要

联合嵌入预测架构(JEPA)使智能体能够通过想象候选动作的结果来在潜在空间中进行规划,但任务规范仍然是一个瓶颈。视觉目标提供精确的局部梯度,但远距离指导较差,而语言很灵活,但受到嘈杂的跨模式对齐或对不同大型生成模型的依赖的限制。我们引入了 LAGO(来自语言的潜在目标预测),这是一种分层世界模型,其中单个预测器既预测动作条件动态,又将语言指令作为中间潜在子目标序列,在共享潜在空间上使用单个回归目标训练这两种模式。在每个规划步骤中,LAGO 都会根据语言指令预测一系列潜在子目标,并使用软最小对齐成本来优化动作序列,该成本可奖励子目标的接近性,而无需强制执行严格的路径。随着智能体状态的发展,子目标会被重新预测,将单个长视野指令转变为一系列局部可处理的目标。在跨越导航和操纵的环境中,LAGO 的表现优于平面和分层图像目标规划器,在具有弯曲、危险受限路径的长视域导航方面收益最大,在相同演示中训练的目标条件行为克隆策略的成功率提高了一倍以上。世界模型自身潜在空间中的基础语言也优于视觉语言奖励模型,包括使用 真值 动态进行规划的模型。