论文

AndroidDaily:现实世界闭源应用程序上移动 GUI智能体 的可验证基准

AndroidDaily: A Verifiable Benchmark for Mobile GUI Agents on Real-World Closed-Source Applications

智能体系统Agent任务评测

摘要

GUI 基础模型和移动 GUI智能体 的快速发展催生了众多评估基准,但大多数都依赖于模拟环境或开源应用程序,而现实世界的闭源应用程序在很大程度上没有得到评估。核心难点在于闭源应用程序不暴露内部状态,使得传统的自动验证不适用。为了弥补这一差距,我们推出了 AndroidDaily,这是一个大规模基准测试,包含 94 个高频 Android 应用程序中的 350 个实际日常使用任务,涵盖交通、购物、本地服务、娱乐、内容创建、社交媒体和日常公用事业。为了在这些不透明的环境中实现自动和可验证的评估,我们提出了基于指南的自动诊断评估审查器(GRADE),这是一个基于可观察的外部指南的三层系统构建的过程感知评估器:操作义务、输出质量和负面约束。 GRADE 根据这些标准跟踪智能体的视觉轨迹,并产生阶梯级诊断判断,将长期、开放式的移动交互转变为可验证的评估,而无需依赖隐藏的内部状态。实验表明,GRADE 与人类评估者的一致性达到 87.37%。最强大的模型在 AndroidDaily 上达到了 62.0% 的成功率,凸显了当前推理能力与现实移动工作流程中的实际执行能力之间的巨大差距。