论文

ActionParty:生成视频游戏中的多主体动作绑定

ActionParty: Multi-Subject Action Binding in Generative Video Games

应用与实践内容创作

摘要

视频传播的最新进展使得能够模拟交互环境的“世界模型”得以发展。然而,这些模型很大程度上仅限于单代理设置,无法在场景中同时控制多个代理。在这项工作中,我们解决了现有视频传播模型中动作绑定的基本问题,该模型很难将特定动作与其相应的主题相关联。为此,我们提出了 ActionParty,一种用于生成视频游戏的动作可控多主体世界模型。它引入了主体状态标记,即持续捕获场景中每个主体状态的潜在变量。通过使用空间偏置机制对状态标记和视频潜伏进行联合建模,我们将全局视频帧渲染与单个动作控制的主题更新分开。我们根据 Melting Pot 基准评估 ActionParty,展示了第一个能够在 46 个不同环境中同时控制最多 7 名玩家的视频世界模型。我们的结果表明,行动跟踪准确性和身份一致性有了显着提高,同时通过复杂的交互实现了对受试者的稳健自回归跟踪。