论文
Oneira:从开放式一代到视频世界模型中的开放世界交互
Oneira: From Open-Ended Generation to Open-World Interaction in Video World Models
摘要
生成视频世界模型现在可以合成开放式环境,Agent可以通过简单的方式进行导航和交互。然而,开放式生成并不意味着完全交互:随着生成的世界的扩展,通过导航新创建的内容应该扩展Agent可以采取的行动,并且随着Agent改变世界,这些变化应该成为环境的持久部分,而不是短暂的视觉效果。我们将这两个要求描述为开放世界交互性,其中新生成或遇到的实体被合并到可操作的世界中,以及持久状态,其中交互结果致力于世界状态并继续影响后续的观察和交互。我们提出了 Oneira,一种交互式视频世界模型,它通过由编码Agent管理的显式、可扩展的世界状态来关闭生成和交互之间的循环。给定当前的观察和行动或高级目标,Agent读取世界状态,确定相关实体,规划交互,并将其结果写回到世界状态表中。当探索发现新物体时,智能体会将它们从生成的观察中合并起来,从而允许交互空间随着生成的世界而扩展。与此同时,先前引发的状态变化会通过视频片段进行传递,从而使交互的后果成为后续世界演变的持久部分。更新后的世界状态沿着相机动作轨迹渲染成粗略调节视频,视频生成器从中填充状态中未表示的外观、运动和交互细节。实验表明,Oneira 能够与新生成的对象进行直接且一致的交互,同时在长期范围内保留先前交互的效果。项目页面:https://madaoer.github.io/projects/oneira