论文
GameWAM:面向视频游戏的世界动作模型
GameWAM: A World Action Model for Video Games
摘要
现代视频游戏结合了第一人称感知、快速视觉变化、持续的世界状态以及异构的原生控制。现有游戏智能体将视觉与任务上下文直接映射为动作,但缺乏显式的世界动力学建模;而交互式游戏世界模型根据给定的动作预测视觉未来,却并不充当任务策略。世界-动作模型(WAM)统一了这两类目标,但在视频游戏的动力学与开放式交互下仍基本未被探索。我们提出GameWAM,据我们所知是首个面向原生闭环游戏玩法与GUI控制的WAM。GameWAM通过并行的视觉与动作生成过程,结合块因果条件化与流匹配,联合生成未来视觉观测和可执行的键鼠轨迹。为支持世界-动作联合学习,我们构建了同步的游戏玩法与GUI轨迹。为处理异构的原生控制,GameWAM在每个动作步预测gameplay/GUI模式,并使用模式特定的预测分布与连续动作归一化来生成动作。对于长时程交互,块循环控制(block-cycle control)在已承诺时域之外进行预测,只执行较短的动作前缀,并根据新观测重新规划,同时以循环内细粒度上下文和分层跨循环历史保持时间连续性。实验表明,与被比较的智能体相比,GameWAM以更少的原生动作执行数取得了有竞争力的任务成功率。我们进一步揭示了低频动作源印记(LASI):在固定条件化下,采样动作源的低频分量会系统性地引导生成的粗略相机运动,揭示了生成式控制中的一种源敏感性失败模式。项目页面见 https://yunncheng.github.io/GameWAM/。
