Game2World 引擎:解锁世界的野外游戏视频 模型训练
Game2World Engine: Unlocking In-the-Wild Gameplay Videos for World Model Training
摘要
视频游戏为视频世界模型提供了可扩展的训练数据源,提供了多样化的环境、复杂的交互和丰富的野外游戏视频。然而,原始游戏画面将游戏世界与屏幕空间界面纠缠在一起,引入了游戏特定的偏见和不相关的动态,阻碍了世界-模型训练。为了解决这个问题,我们引入了 GameUI-Taxonomy 和 G2WEngine,这是一个将游戏 UI 基础和删除形式化的全栈框架。 G2WEngine 自动从真实游戏视频中提取可重用的 UI 资源,并在干净的素材上合成时间连贯的 UI 叠加层。使用该引擎,我们构建了 Game2World,其中包含具有精确重建目标的 96K 合成配对视频和来自 303 个游戏的 1,079 个野外剪辑,用于进行真实评估。其资产库包含 21 个分类类别的 5,132 个经过验证的 UI 元素,这些元素是从 1,010 个代表性游戏框架中收集的。基于 Game2World,我们提出了 GameCleaner,一种无遮罩的游戏 UI 去除模型,它将多模态语义理解与视频编辑功能相结合。与基于遮罩的方法不同,GameCleaner 直接识别并删除不同的 HUD 元素,同时保留底层场景内容和时间动态。在受控试点中,与使用 UI 覆盖数据训练的世界模型相比,使用无 UI 游戏训练的世界模型将整体视频奖励提高了 6.83%。在 UI 去除评估中,GameCleaner 在合成视频上实现了 95.36 的平均 AAR,比最强时间掩模基线高出 57.3%,并在 99.8 的背景保留下获得了 80.05 的最佳野外 AAR。这些结果证明了将互联网游戏视频转换为高质量的世界 模型训练 数据的可扩展潜力。代码、数据集和模型将在 https://github.com/Dongping-Chen/Game2World 上提供。