论文
StatePlay:用于力学一致生成的状态感知游戏世界模型
StatePlay: State-Aware Game World Models for Mechanics-Consistent Generation
摘要
最近的游戏世界模型可以根据玩家的动作生成视觉上逼真的交互式环境。然而,游戏并不仅仅由像素来定义。它们受明确的机制控制,即控制生命值减少、技能激活和游戏终止的状态相关规则。这些机制取决于精确的内部状态,例如生命值、技能表和计时器,它们与视觉观察紧密结合并决定游戏玩法如何发展。如果不对这些状态动态进行建模,现有的游戏世界模型可能会生成视觉上合理的部署,但违反了底层的游戏规则。在本文中,我们提出了 StatePlay,这是一种新颖的状态感知游戏世界模型,它联合预测视觉内容和游戏状态以促进机制一致的生成。 StatePlay 采用 Transformer (MoT) 混合式架构,保留专门的视觉和状态表示,同时实现跨模式交互,允许预测状态指导帧生成。每个分支都根据适合其模式的独特目标进行进一步优化。实验表明,StatePlay 的状态预测平均归一化 L1 距离低于 0.06。此外,与没有显式状态建模的模型相比,我们的方法将生成的游戏生成轨迹的机制保真度提高了 18.6%。总的来说,我们的工作强调了状态感知游戏世界建模的重要性,并超越了像素级现实主义,迈向完整且机械忠实的游戏生成。