论文

在世界模型中训练物体恒存性

Training Object Permanence in World Models

模型训练合成数据

摘要

物体恒存性与坚固性是人类认知先验的标志。近期研究表明,视频生成模型——当前世界模型的典型代表——已开始显现涌现的推理能力,使其成为构建类人物理智能的理想候选。视频模型是否已涌现出物体恒存性?如果没有,我们能否用一个受核心认知启发的数据集来训练它?我们提出WROP(World Reasoning with Object Permanence),一个包含150个手工设计、认知科学启发任务的数据基础设施,分为六个认知类别。我们构建了Blender生成器,在保持每个任务认知结构的同时随机化速度、光照、相机角度等干扰参数,每个任务产出超过10000个样本。我们发布了一个150万样本的训练语料与一套300题的考试集。在该考试集上我们评测了14个视频模型:3个reference-to-video、7个编辑模型与4个续写模型,其中包括我们的16B世界模型PWM-WROP。在一项盲测成对Elo研究中,PWM-WROP在续写模型中排名第一,总排名第三,仅落后于两个reference-to-video模型之间的统计平局。我们发布了数据、考试集、模型答案、分数、权重,以及PWM——我们在AWS Trainium2上的原生PyTorch训练栈。

在世界模型中训练物体恒存性:论文配图
图 1:WROP:面向客体永久性的世界推理。我们为视频生成模型中的客体永久性与坚固性引入一套基准和训练资源,其构建基于跨六个任务族的 150 个手工设计的 Blender 生成器。每个生成器在保留任务核心认知科学结构的同时,随机化光照、相机角度、速度及其他干扰参数,每个任务产出 10,000 个样本。我们发布了这一 150 万样本的训练语料、一份包含 300 道题、对 14 个视频生成模型带人类 Elo 评分的评测试卷,以及 PWM-WROP——一个在 WROP 数据上微调的续写模型,在其类别中达到最先进性能。