论文

相同的任务,不同的应用程序:为什么移动 GUI Agent无法泛化?

Same Tasks, Different Apps: Why Mobile GUI Agents Fail to Generalize?

智能体系统Agent任务评测

摘要

在实际设置中部署的移动 GUI Agent必须跨支持相同功能的不同应用程序工作。大多数现有基准测试仅在一个应用程序中测试每项任务,因此高分可能意味着Agent理解该任务,或者仅意味着它知道该特定应用程序。我们引入了 AnyAppBench,这是一个类别控制的实时 Android 基准测试,可评估跨应用程序的泛化性,同时保持用户目标固定。它涵盖 10 个功能类别、100 个任务模板以及超过 52 个应用程序的 520 个任务应用程序对。Agent根据原始指令和独立于应用程序的子目标运行,VLM 评审根据固定故​​障分类法对每次失败的运行进行标记,其可靠性由人工注释来衡量。我们发现,在 13 个Agent中,原始应用程序的成功并不能可靠地转移到具有相同目标的新应用程序。此外,提供高级子目标分解只会产生小的、与类别相关的变化,而不会缩小差距,并且故障类型的混合会随着目标接口的变化而变化。基于这些见解,我们相信 AnyAppBench 基准测试为移动 GUI Agent的稳健实际部署提供了重要的垫脚石。我们的代码、数据和排行榜可以在项目网站https://anyappbench.github.io/.找到