CausalDreamer:学习具有潜在解缠的预测世界模型
CausalDreamer: Learning Predictive World Models with Latent Disentanglement
摘要
控制的世界模型必须捕获环境的哪些方面对代理的行为做出反应以及哪些方面与奖励相关。 Dreamer 4 等生成世界模型由视频标记器和动态模型组成,视频标记器将每个帧编码为潜在变量,动态模型经过预训练,可根据过去的潜在变量和动作预测未来的潜在变量。然而,标记器是用重建目标进行训练的,没有动作或奖励监督,因此它的潜在机制没有提供明确的机制来分离可控、不可控、奖励相关和奖励无关的信息。我们提出 \textit{CausalDreamer},它使分词器保持冻结状态,并将其潜伏重新编码为沿两个轴的四个组的分解表示:可控性,其中只有两个可控组接收动作,以及奖励相关性,通过预测两个奖励相关组的奖励来学习。然后对预训练的动力学模型进行微调以预测因子表示。我们评估 \textit{CausalDreamer} 及其开始的预训练世界模型 对 20 个 MMBench2 任务进行模型预测规划:训练期间看到的 10 个干净任务和 10 个未见过的任务,其中 6 个是经过更改的背景、对象或迷宫布局的干净任务的操纵变体,4 个是新环境。我们对回报进行归一化,以便采用均匀随机操作的策略得分为 0,专家得分为 1。 \textit{CausalDreamer} 在干净任务上的归一化得分比预训练的世界模型高出 14\%(0.199 vs.\ 0.175),在操纵变量上得分高出 25\%(0.307 vs.\ 0.246),而这两个模型的得分都没有明显高于新任务中的随机策略。环境。此外,我们的分析表明,因子表示将与奖励无关的变化(例如背景变化)与其奖励相关的群体分开。