论文
以Agentic游戏开发作为扩展世界模型的可验证轨迹数据引擎
Agentic Game Development as a Verifiable Trajectory Data Engine for Scaling World Models
摘要
扩展世界模型的常见策略是用更多算力在更多爬取视频上训练。我们认为该策略效率低下:扩展世界模型还需要一个能提供有依据奖励信号的递归数据引擎。代码智能体的成功说明了这为何重要。由于代码可执行,编译器与运行时能够为大语言模型的强化学习(RL)后训练提供高质量奖励。相比之下,空间生成仍在很大程度上依赖CLIP分数等模糊代理指标。这些信号模糊且有偏,难以支撑RL后训练。与它们相比,游戏开发为空间世界模型提供了缺失的奖励环境。由游戏引擎编码的场景是一份可执行的世界规格说明:引擎可以高效检查碰撞、物理、可导航性与有界可玩性,而开发者通过判断场景是否应被接受来提供全局验证信号。游戏开发还为RL后训练提供真实的长程轨迹数据。因此我们提出人-引擎验证强化学习(RLHEV),一种将稠密引擎信号与开发过程中的隐式人类验收反馈相结合的后训练范式。
