论文

GUI智能体 用于连续游戏生成

GUI Agents for Continual Game Generation

智能体系统Agent任务评测

摘要

生成一款游戏并不等同于让一款游戏变得可玩。现有的代码生成方法通常将提示直接转换为工件,而无法检测到交互级别的故障。我们认为游戏生成需要一个玩家并研究图形用户界面(GUI)代理的两个角色。首先,我们介绍 \textbf{PlaytestArena},这是一个评估环境,包含 8 个类型的 200 个基于浏览器的游戏生成任务,每个任务都与预期游戏中行为的规则配对。独立的 GUI 法官会加载并播放每个版本来裁决这些规则。其次,我们提出 \textbf{Play2Code},其中游戏代理和盲注 GUI 游戏测试器通过共享内存迭代生成、玩和优化游戏。游戏测试者提供游戏轨迹和可操作的反馈,而单独的 GPT-5.5 法官则分配最终基准分数。在三个前沿骨干网中,Play2Code 实现了 66.8% 的 rubric 通过率,分别比单通道和代理编码基线高出 37.1 点和 14.6 点。它的分数也在各轮优化中单调提高。进一步分析表明,GUI智能体 反馈已完全记录并可追踪,但其优先级在不同模型主干之间存在很大差异。这些结果将 GUI 游戏测试确立为交互式代码生成的评估和细化信号。我们的项目网站位于 https://continual-game- Generation.vercel.app/