论文
世界模型自我-蒸馏:训练世界模型来解决一般任务
World Model Self-Distillation: Training World Models to Solve General Tasks
摘要
预训练的视频生成器是有前景的视觉世界模型,具有突发任务解决能力;然而,它们对详细文本描述的依赖限制了它们直接用于规划和决策。现有方法要么将这种推理外包给语言或视觉语言模型,要么依赖带有配对任务执行视频的监督 微调,这些视频的收集成本高昂且难以扩展。我们提出了一个可扩展的框架,通过将 self-蒸馏 与强化学习相结合,在此类模型中激发任务解决能力。给定未标记的场景图像,视觉语言模型会生成候选任务和详细的分步解决方案。该解决方案以预先训练的视频扩散模型(演示器)为条件;我们将其行为提炼为仅以图像和简短任务提示为条件的执行器。这将执行知识从视频描述引导生成转移到指令条件任务解决,而无需策划任务视频监督。我们通过 VLM 反馈的强化学习进一步改进执行器,利用判断采样视频是否满足任务和生成解决方案之间的不对称性。我们提出的 WorldTasks-Benchmark 和 DreamGen 机器人基准测试表明,在我们基于 VLM 的评估协议下,执行器超越了演示器,并且有竞争力地转移到机器人任务。