论文

在富有挑战的真实场景中评测通用移动助手

Benchmarking General Mobile Assistants in Challenging Real-World Scenarios

智能体系统Agent任务评测

摘要

图形用户界面已成为评估自主人工智能代理在多模态交互任务上的重要环境。 AndroidWorld 和 MobileWorld 等现有基准为移动代理评估提供了坚实的基础,但它们的应用程序覆盖范围和任务设计尚未完全捕捉实际移动使用的多样性和复杂性。我们提出了 GMA,这是一个在具有挑战性的现实场景中评估通用移动助理的基准。 GMA 推出了 7 个基于开源项目的应用程序,涵盖生活方式共享和旅行规划等领域,以及跨越四个难度级别的 300 项任务,从原子操作到复杂的多步骤工作流程。我们评估了八个前沿模型,发现随着任务复杂性的增加,性能大幅下降,当前的代理还远远不能可靠地处理实际的用户需求。我们进一步在共享环境、模型设置和任务分类下对智能体控制选择进行受控消融研究,包括上下文保留和显式状态跟踪。结果表明,适当的线束设计可以显着提高性能,特别是在要求苛刻的工作流程中,而特定设计的有效性可能因基础模型而异。总体而言,GMA 通过扩展应用程序覆盖范围和任务复杂性来补充现有基准,为评估移动代理和研究线束设计如何支持复杂移动工作流程中的可靠执行提供具有挑战性的测试平台。

在富有挑战的真实场景中评测通用移动助手:论文配图
图1:全球海洋环境状况评估概览。全球海洋环境状况评估提供了多样化和可复制的移动生态系统,有7种定制应用,还有300项任务,涉及四个要求逐渐更高的层次:原子、构成、交叉应用和现实。我们进一步研究了智能体商Harness的作用,包括保留上下文、明确的国家跟踪和特定智能体商Harness设计。对全球海洋环境状况评估的评价表明,随着任务复杂性的提高,业绩严重退化,并突显了为复杂的流动工作流程设计有效的智能体Harness的重要性日益增加。