论文
WildWorld:用于动态世界建模的大型数据集,具有针对生成 ARPG 的动作和显式状态
WildWorld: A Large-Scale Dataset for Dynamic World Modeling with Actions and Explicit State toward Generative ARPG
摘要
动力系统理论和强化学习将世界演化视为由行为驱动的潜在状态动态,视觉观察提供了有关状态的部分信息。最近的视频世界模型试图从数据中学习这种以动作为条件的动态。然而,现有的数据集很少满足要求:它们通常缺乏多样化且语义上有意义的动作空间,并且动作直接与视觉观察相关,而不是由底层状态介导。因此,动作常常与像素级的变化纠缠在一起,使得模型很难学习结构化的世界动态并在长期范围内保持一致的进化。在本文中,我们提出了 WildWorld,这是一个具有明确状态注释的大规模动作条件世界建模数据集,是从逼真的 AAA 动作角色扮演游戏(《怪物猎人:荒野》)中自动收集的。 WildWorld 包含超过 1.08 亿帧,具有超过 450 个动作,包括移动、攻击和技能施放,以及角色骨架、世界状态、相机姿势和深度图的同步每帧注释。我们进一步推导出 WildBench,通过动作跟踪和状态对齐来评估模型。大量的实验揭示了对语义丰富的动作进行建模和保持长期状态一致性方面持续存在的挑战,这凸显了对状态感知视频生成的需求。项目页面为https://shandaai.github.io/wildworld-project/。