论文

回归简约潜变量:从视觉基础模型学习以任务为中心的世界模型

Back to Parsimonious Latents: Learning Task-Centric World Models from Visual Foundations

模型训练预训练

摘要

世界模型使智能体能够在给定动作的条件下预测未来动态,这使得潜表示的选择成为规划与控制的核心。这类表示通常要么直接从像素学习而语义结构有限,要么继承自冻结的视觉基础模型而包含过多与任务无关的细节,导致状态空间与下游规划和控制匹配不佳。这在无奖励的离线设定中尤其具有挑战性,模型必须从固定轨迹中学习,既没有奖励监督也没有在线交互。为此,我们提出TC-WM,一个将基础模型嵌入转化为紧凑且任务充分的世界表示的框架。其关键设计是将预训练嵌入空间视为语义脚手架而非最终状态空间:TC-WM将高维视觉嵌入线性投影为紧凑潜变量作为动态空间,通过对比学习将一个子空间与智能体的物理状态对齐,并通过重建嵌入来保留有用的视觉结构。这结合了基础特征的通用性与以任务为中心的动态的可控性。在理论上,我们证明TC-WM足以在相差一个简单变换的意义下识别底层的以任务为中心的潜因子。在实证上,TC-WM支持在多样化环境(如Robomimic和D4RL)中进行测试时规划,相较最先进方法取得更好的世界建模质量和更精确的控制。

回归简约潜变量:从视觉基础模型学习以任务为中心的世界模型:论文配图
图3:TC-WM方法:利用本体感知等任务侧信息,从预训练视觉嵌入中提取紧凑的以任务为中心的潜空间动力学,训练世界模型。