论文
GWM:以语言目标指导潜在世界模型规划
Grounded World Model: Latent Planning with Language Goals
摘要
DINO-WM、LeWM等世界模型以图像指定目标,而新任务通常难以提前获得目标图像。我们提出Grounded World Model(GWM),一个可仅从语言目标出发进行真实世界零样本规划的潜在世界模型。给定候选动作序列与当前观测,GWM在预训练视频语言嵌入模型的视觉空间中预测未来。冻结的读出模块将预测未来与任务描述映射到同一嵌入空间,其负余弦相似度作为规划代价。训练仅需离线、任务无关的视频—动作对,不需语言标注。WISER仿真中,选择最低代价候选动作的GWM完成288项未见指令与视觉信号任务中的87%,十个微调VLA平均为22%。我们用真实机器人数据扩展模型,进行逼真仿真与真实场景零样本规划。IsaacSim中,GWM完成14类需要指代表达推理任务的全部70次试验,与由前沿VLM定位的模块化规划器相当,pi0.5完成37次。真实Franka上,同一系统完成分别评价的抓取放置子任务55/60次,模块化规划器为52/60;完整系统在单张消费级GPU本地运行。项目:https://quanyili.github.io/gwm-wiser/。