论文
SimuWoB:模拟真实世界的移动应用程序以实现快速、可靠的 GUI 代理基准测试
SimuWoB: Simulating Real-World Mobile Apps for Fast and Faithful GUI Agent Benchmarking
摘要
由大语言模型支持的移动 GUI 代理发展迅速,迫切需要现实和全面的评估。现有的基准优先考虑可重复性,但通常仅限于开源应用程序或文件操作任务,因为难以在实际应用程序上构建奖励,从而在基准设置和实际使用之间留下了差距。此外,大多数基准测试都侧重于基本的基础和导航,而对复杂的长期交互的覆盖范围有限。为了解决这些限制,我们引入了 SimuWoB,这是一个针对移动 GUI 代理的完全综合基准,具有 120 个跨越不同类型和难度级别的挑战性任务。我们构建了一个强大的虚拟环境生成框架,该框架综合了高保真任务和环境,并自动为每个任务提供有效的奖励。每个环境都部署为可通过 URL 访问的无后端网页,从而实现高效且可重复的评估。我们对几种最先进的移动 GUI 代理进行了全面的实验。平均成功率仅为 27.92%,在长期任务上下降至 17.82%,这暴露了当前智能体在复杂场景下的显着弱点。评估结果与现实世界样本任务的比较表明,基于我们的合成环境的代理评估具有良好的泛化性。我们进一步提供跨关键功能维度的诊断见解,并讨论对未来移动 GUI 代理开发的影响。
