论文

RoboTALES:通过任务对齐的模拟未来学习推理引导的机器人策略

RoboTALES: Learning Reasoning-Guided Robot Policies via Task-Aligned Simulated Futures

模型训练强化学习

摘要

预训练的视频生成模型是视觉运动控制的有前途的支柱,但它们想象的未来往往偏离任务意图,并且不可靠地以动作为条件。因此,这些模型可能难以用于规划或政策提取。为了解决这些限制,我们提出了 RoboTALES,这是一个单阶段框架,可以学习与任务一致的模拟未来,并使用它们来训练机器人策略。我们的方法引入了两个关键创新:(1)基于 LLM 的分层规划器,它将复杂的任务分解为一系列子目标,以指导模型的想象力; (2) 基于 VLM 的批评家,评估这些“想象的”未来,并使用基于奖励的反馈来保持模型的内部表征专注于目标。通过将视频生成器锚定在抽象推理中,我们可以产生时间一致的滚动和更连贯的动作。我们在 RoboCasa 和 LIBERO10 的各种操作任务上评估了 RoboTALES,并表明我们的方法始终优于现有方法,尤其是在长期任务中。我们的代码和模型可在 https://github.com/hananshafi/RoboTALES 上公开获取。