论文
GBQA:评估 LLM 作为质量保证工程师的游戏基准
GBQA: A Game Benchmark for Evaluating LLMs as Quality Assurance Engineers
摘要
自主发现错误仍然是现代软件开发中的重大挑战。与代码生成相比,动态运行时环境的复杂性使得 大语言模型 (LLM) 的错误发现变得相当困难。在本文中,我们以游戏开发为代表领域,引入游戏质量保证基准(GBQA),该基准包含 30 个游戏和三个难度级别的 124 个人工验证的错误,以评估 LLM 是否能够自主检测软件错误。该基准测试是使用多代理系统构建的,该系统以可扩展的方式开发游戏并注入错误,并由人类专家参与循环以确保正确性。此外,我们提供了一个配备多轮 ReAct 循环和记忆机制的基线交互代理,可以对游戏环境进行长期探索,以跨不同的 LLM 进行错误检测。前沿 LLM 上的大量实验表明,自主 bug 发现仍然极具挑战性:表现最好的模型 Claude-4.6-Opus 在思维模式下仅识别出 48.39% 的已验证 bug。我们相信 GBQA 提供了足够的测试平台和评估标准,并且其进一步进展将有助于缩小自主软件工程方面的差距。