论文
在富有挑战的真实场景中评测通用移动助手
Benchmarking General Mobile Assistants in Challenging Real-World Scenarios
摘要
图形用户界面已成为评估自主人工智能代理在多模态交互任务上的重要环境。 AndroidWorld 和 MobileWorld 等现有基准为移动代理评估提供了坚实的基础,但它们的应用程序覆盖范围和任务设计尚未完全捕捉实际移动使用的多样性和复杂性。我们提出了 GMA,这是一个在具有挑战性的现实场景中评估通用移动助理的基准。 GMA 推出了 7 个基于开源项目的应用程序,涵盖生活方式共享和旅行规划等领域,以及跨越四个难度级别的 300 项任务,从原子操作到复杂的多步骤工作流程。我们评估了八个前沿模型,发现随着任务复杂性的增加,性能大幅下降,当前的代理还远远不能可靠地处理实际的用户需求。我们进一步在共享环境、模型设置和任务分类下对智能体控制选择进行受控消融研究,包括上下文保留和显式状态跟踪。结果表明,适当的线束设计可以显着提高性能,特别是在要求苛刻的工作流程中,而特定设计的有效性可能因基础模型而异。总体而言,GMA 通过扩展应用程序覆盖范围和任务复杂性来补充现有基准,为评估移动代理和研究线束设计如何支持复杂移动工作流程中的可靠执行提供具有挑战性的测试平台。
