论文

WebGameBench:基于浏览器原生游戏的编码智能体需求到应用评估

WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games

智能体系统Agent任务评测

摘要

编码智能体越来越多地被用作应用构建者,但许多评估仍聚焦于源代码、仓库级测试或中间轨迹,而非交付的应用本身。我们提出WebGameBench,一个需求到应用的基准,评估编码智能体能否将一份冻结的结构化网页游戏规格说明变成可通过浏览器访问的游戏。浏览器原生游戏提供了一个紧凑但行为密集的测试床:即便是简单游戏也需要协调的输入处理、空间映射、规则执行、状态转换、终止条件、重开行为与可见反馈。在WebGameBench中,每个生成的制品都在统一部署协议下被构建、服务,并以可通过浏览器访问的应用形式暴露。随后,运行时评估器在真实浏览器中与交付的游戏交互,并给出三档标签:EXCELLENT、USABLE或UNUSABLE。在人工审核的子集上,运行时标签在Usable-rate准则下与人工试玩审核大体一致。横跨111个任务、12个编码智能体与14种评估配置,WebGameBench有效区分了现有系统:最佳配置达到76.9%的可用率,但优秀率仅为20.2%。这一差距表明,跨过最低可玩交付门槛与完全满足需求之间仍有很大距离。据我们所知,WebGameBench是首个面向浏览器原生游戏交付的需求到应用基准,在Usable-rate准则下以独立的人工试玩审核验证交付应用的运行时标签。

WebGameBench:基于浏览器原生游戏的编码智能体需求到应用评估:论文配图
图 1:浏览器原生工件的试点研究。我们使用“Opus 4.6”来比较同一生成和评估流程下的 H5、工具、Web、问卷和游戏任务。可用率对标记为“优秀”或“可用”的工件进行计数;优秀率计算标记为优秀的工件。结果仅用于确定基准范围,不用于主要模型比较。