论文

GameXpert-Bench:编码智能体距离专家级游戏开发还有多远?

GameXpert-Bench: How Far Are Coding Agents from Expert Game Development?

智能体系统Agent任务评测

摘要

近期的大语言模型(LLM)可以作为编码智能体,根据自然语言请求构建完整的游戏。游戏开发的要求尤其苛刻,因为程序逻辑、视觉与音频内容、接口、交互与可玩性必须在一个可执行产物中同时正常运作。因此,衡量这一能力需要同时评估游戏产品和开发过程。现有基准通常通过评估最终产物或孤立的开发阶段来衡量LLM的游戏开发能力。我们对完整的人-智能体开发轨迹的分析识别出三个阶段,它们共同覆盖了使用编码智能体进行游戏开发的完整生命周期:初始游戏生成、缺陷诊断与修复,以及多轮次优化。因此,我们提出GameXpert-Bench,将这三个生命周期阶段落实为三个互补的基准轨道。GameGen评估在空工作区中从单个请求完整生成游戏的能力。GameFix评估在缺陷被报告或留给智能体自行发现时的诊断与修复能力。GameOpt评估以真实用户-智能体开发轨迹为种子的请求链驱动的累积优化能力。我们采用实时游戏交互、确定性行为测试或带回归检查的最终产品标准来评估各轨道。该套件包含覆盖11种游戏类型的97个生成任务;100个修复任务,来自50个经人工验证的游戏关卡,每个关卡含19-27个注入缺陷;以及17条含六轮、共102个请求的优化链。在三个轨道上,当前智能体在产出可玩基础版本和实现明确需求方面,比在发现缺陷、验证运行时行为和跨变更保持功能方面更为可靠。

GameXpert-Bench:编码智能体距离专家级游戏开发还有多远?:论文配图
图1:GameXpert-Bench 及其三条评估轨道概览。GameGen 评估从自然语言需求出发的游戏创建,GameFix 评估对损坏参考游戏的修复,GameOpt 评估基于人类反馈的多轮游戏优化。