论文

多长,而不是多近:潜在世界模型中规划的学习时间度量

How Long, Not How Close: A Learned Temporal Metric for Planning in Latent World Models

模型推理推理搜索与路径规划

摘要

潜在世界模型通过在候选动作序列下向前滚动冻结的预测器来进行计划,并根据候选者想象的最终状态与目标之间的潜在距离对候选者进行排名。然而,当目标距离几个计划之遥时,这种排名就会崩溃,因为潜在距离衡量的是最终状态与目标的相似程度,而不是距离达到目标还有多远。为了解决这个问题,我们提出了 TEMPO,一种时间距离规划目标,它不影响世界模型,仅从已经用于训练它的演示中学习,并且给规划者的搜索增加的成本可以忽略不计。 TEMPO 学习一个冻结潜伏的小地图,其中一个情节的两个状态之间的距离反映了它们之间的环境步骤数,并将该距离混合到规划器的成本中。它不需要奖励、策略或成功标签,并且作为成本而不是模型,适用于每个状态有一个潜在向量的冻结世界模型,该模型按潜在距离进行规划。我们使用 LeWM 和 PLDM 规划器在 11 个模拟环境(例如迷宫导航、桌面推动、机械臂控制和三维操作)上评估 TEMPO。 TEMPO 的小型 MLP 最多可为计划算术增加 0.3%,从而在每个目标距离(包括评估的单计划设置)上改进两个规划器,将 TwoRoom 三个计划的 LeWM 从目标的 36% 提高到 99%,并在广泛的 2D 和 3D 导航、到达和操作任务中保持竞争力。

多长,而不是多近:潜在世界模型中规划的学习时间度量的原论文方法或结果图
图 2:规划器中的 TEMPO。 LeWM 的冻结编码器 $E$ 和预测器 $\mathrm{WM}$(蓝色)保持不变,并且没有任何内容被解码。规划器在每个 CEM 候选计划下推出 $\mathrm{WM}$,并执行最小化 $J$ 的计划。 TEMPO 添加了地图 $F_{\phi}$(橙色),并通过 $\lVert F_{\phi}(\hat{z}_{t+25})-F_{\phi}(G)\rVert^{2}$ 对每个候选计划进行评分,其最终状态仍然是从目标开始的步骤,添加到 LeWM 的成本中。右上:$F_{\phi}$ 将一集的帧每 25 步间隔一个单位。