论文
GameEngineBench:在真实 C++ 运行时环境上评估 编码智能体
GameEngineBench: Evaluating Coding Agents on Real C++ Runtime Environments
摘要
游戏引擎提供实时模拟、渲染、物理、交互、网络和资产管道,使其不仅对游戏有价值,而且对医疗保健、机器人、建筑、制造和相关领域的 3D 应用也有价值。由于游戏开发是这些系统最成熟且公开可用的领域,因此它提供了一个用于评估 编码智能体 的实用测试平台,该测试平台必须在有状态、交互式、实时系统中修改 C++ 代码。我们推出了 GameEngineBench,这是一个用于评估 编码智能体 虚幻引擎 5 项目内范围 C++ 实现任务的基准,由九个真实世界的游戏存储库构建。该评估集包含 110 个任务,涵盖游戏机制、多人游戏行为、AI 和世界编排、动画和运动、UI 和会话代码、加载行为、在线服务集成、持久性、数据序列化、XR 行为和面向渲染的插件。这些任务需要模型进行原生 C++ 更改,以编译并满足可执行虚幻引擎项目中的行为测试。在 12 种评估的配置中,最强的模型达到 55.5\% pass@1,而每种配置仍有 31 项任务未解决。我们的结果表明,前沿 编码智能体 继续在实时交互软件的深度集成 C++ 开发方面苦苦挣扎,强调游戏引擎基准测试是对现有软件工程评估的宝贵补充。