论文

以Agentic游戏开发作为扩展世界模型的可验证轨迹数据引擎

Agentic Game Development as a Verifiable Trajectory Data Engine for Scaling World Models

模型训练强化学习

摘要

扩展世界模型的常见策略是用更多算力在更多爬取视频上训练。我们认为该策略效率低下:扩展世界模型还需要一个能提供有依据奖励信号的递归数据引擎。代码智能体的成功说明了这为何重要。由于代码可执行,编译器与运行时能够为大语言模型的强化学习(RL)后训练提供高质量奖励。相比之下,空间生成仍在很大程度上依赖CLIP分数等模糊代理指标。这些信号模糊且有偏,难以支撑RL后训练。与它们相比,游戏开发为空间世界模型提供了缺失的奖励环境。由游戏引擎编码的场景是一份可执行的世界规格说明:引擎可以高效检查碰撞、物理、可导航性与有界可玩性,而开发者通过判断场景是否应被接受来提供全局验证信号。游戏开发还为RL后训练提供真实的长程轨迹数据。因此我们提出人-引擎验证强化学习(RLHEV),一种将稠密引擎信号与开发过程中的隐式人类验收反馈相结合的后训练范式。

以Agentic游戏开发作为扩展世界模型的可验证轨迹数据引擎:论文配图
图1:从主观奖励代理到人–引擎验证闭环。传统空间数据流程将稀疏的人类或模型标注转化为含噪的最终输出奖励。游戏开发闭环则可将人类意图与反馈同引擎执行、开发轨迹、渲染证据以及定位化的验证器失败配对,使未来的构建者既能从有依据的检查中改进,也能基于轨迹而非仅凭最终产物运用开发者判断来改进。