论文

EgoCS-400K:以自我为中心的世界模型游戏数据集

EgoCS-400K: An Egocentric Gameplay Dataset for World Models

模型评测基准与评测资源

摘要

从视频生成到交互式世界建模的转变对数据提出了新的要求:除了字幕视频之外,世界模型还需要基于驱动未来场景变化的动作、摄像机运动、状态和事件的时间对齐的视频动作语言轨迹。然而,此类数据很难大规模获得。网络视频数据集提供了广泛的视觉覆盖范围,但缺乏可执行的操作和可靠的状态;机器人数据集提供动作和状态监督,但成本高昂且场景多样性有限;现有的模拟器往往缺乏大规模的人类驱动的交互轨迹。在本文中,我们介绍了 EgoCS-400K,这是一个用于世界模型的大规模基于回放的以自我为中心的《反恐精英》数据集,由公共专业 CS 和 CS2 比赛演示构建,可保留人类游戏轨迹并支持解析、重播、渲染和时间对齐。我们提取玩家状态、视图方向、动作、键盘/按钮输入、视角变化、武器使用、游戏事件和回合级别上下文,并从相同的轨迹渲染干净的第一人称视频。 EgoCS-400K 包含超过 400,000 个第一人称视频和 10,000 小时的游戏时间,来自 1,000 多场比赛和 40,000 轮比赛,涵盖 13 张地图和每轮 10 个玩家视角。它支持一系列交互式视觉建模任务,包括以动作为条件的未来预测、状态和事件感知场景轨迹生成、基于回放的描述以及代理以自我为中心的动作理解。通过将视觉观察与人类行为、摄像机运动、游戏状态和大规模事件联系起来,EgoCS-400K 成为被动网络视频、可控游戏模拟和昂贵的现实世界体现数据之间的实用桥梁。