论文
DreamFormer:使用 Transformer 世界模型进行梦境模仿,用于语言条件的机器人操作
DreamFormer: Dream Imitation with a Transformer World Model for Language-Conditioned Robotic Manipulation
摘要
我们介绍 DreamFormer,这是一种基于模型的智能体,它通过在学习的世界模型的潜在想象中模仿专家演示来获得语言条件的多任务技能。 DreamFormer 首先从非结构化游戏数据中学习与任务无关的 Transformer 世界模型,然后通过优化内在奖励来获取特定于任务的行为,该内在奖励将智能体生成的执行轨迹与潜空间中的专家演示对齐。由于策略在想象中在策略上进行训练,因此在训练期间它会暴露于自己的错误,从而减轻离线行为克隆固有的协变量变化。为了使长期想象力成为可能,DreamFormer 将高分辨率多视图机器人观察编码到单个输入token中,避免了空间下采样和先前 Transformer 世界模型使用的多token表示。在长期 CALVIN 基准测试中,DreamFormer 在单一环境评估方面优于 LUMOS(基于类似模型的智能体)(每五个链完成的平均任务分别为 2.52 和 2.34),同时保持想象力执行轨迹易于处理。与行为克隆基线 HULC 相比,它在零样本迁移到未见过的环境中的性能几乎翻了一番(1.30 vs 0.67),这表明世界模型学到的动态比直接克隆的策略更容易迁移。这与生物智能体中内部模型的作用一致,其中环境动力学模型支持以前未遇到过的情况下的行为。
