论文

ActWorld:通过动作感知记忆从可探索的世界模型到交互式的世界模型

ActWorld: From Explorable to Interactive World Model via Action-Aware Memory

摘要

交互式世界模型旨在模拟实时用户操作下的环境动态。然而,他们的动作词汇很大程度上局限于导航:大多数动作对应于运动(例如行走、转身、环顾四周),而与场景中的物体的交互(例如拿起盘子、开门或触发物理反应)要么不存在,要么仅限于游戏领域,要么被降级为提示到完整视频的场景。由此产生的世界在视觉上是可以探索的,但并不是真正可操作的。在这项工作中,我们提出了 ActWorld,一种交互式世界模型,它扩展了先前以导航为中心的生成器,以支持块自回归框架内的轨迹生成过程中的对象交互。我们认为导航交互差距源于两个瓶颈。首先,数据瓶颈:缺乏具有准确、密集标签的人机交互数据。其次,内存瓶颈:现有世界模型中的新近度偏向历史压缩会丢弃因果决定后续对象状态的事件转换框架,从而导致忘记动作的病态。在数据方面,我们构建了一个 100K 交互视频数据集,每个数据集都通过思想链推理用每个片段的描述进行注释。在模型方面,我们引入了一种分层的动作感知内存设计,该设计通过交互重要性来路由历史压缩,并辅以持久内存库,该内存库在长轨迹生成过程中维护事件更新和对象身份词元。实验表明,ActWorld 在单个模型中支持灵活的导航和丰富的对象交互,与仅导航的基线相比,显着提高了交互保真度,而无需牺牲视点控制。项目页面位于 https://interactwm.github.io/ActWorld。