论文

可编程世界模型

Programmable World Model

应用与实践内容创作

摘要

最近的视频世界模型产生了越来越现实和交互式的视觉体验,但缺乏可靠的机制来维持持久的世界状态并在扩展交互中执行可编程规则。我们引入了可编程世界模型,这是一个将世界状态演化与视觉观察生成分离的框架。代理将自然语言指令转换为指定实体状态和状态转换规则的可执行程序,从而能够直接控制各个实体及其交互。轻量级引擎执行这些程序来更新和维护明确的、持久的全局世界状态,包括屏幕外实体和非视觉属性。为了将世界状态与视觉生成联系起来,我们引入了状态增强的 3D 定向边界框 (OBB) 作为中间表示。该表示与目标摄像机轨迹一起被确定性地编译成像素对齐的时空调节信号,用于用作生成渲染器的预训练视频模型。这种设计允许用户创建具有预定义机制的可玩游戏、对单个实体的直接控制以及整个游戏过程中持久的世界状态。我们进一步介绍 CombatStateBench,一个评估可编程世界模型的基准。在 CombatStateBench 上,我们的方法实现了 94% 的计数精度和 98% 的状态精度,大大优于现有的交互式视频世界模型,同时支持相干的长视野生成。这些结果证明了将显式状态演化与生成渲染分离以构建持久的可编程世界的有效性。