论文
超越顺序交互:面向GUI智能体并行执行与协作的基准测试
Beyond Sequential Interaction: Benchmarking Parallel Execution and Coordination for GUI Agents
摘要
图形用户界面(GUI)智能体是由大型多模态模型(LMM)驱动的系统。它们感知屏幕状态,并通过在桌面和移动设备上点击、键入、滚动等GUI操作来执行用户指令。然而,当前智能体在长程任务上扩展性不佳:每次动作都需要代价高昂的LMM推理,且性能随上下文增长而下降。人类会将这类工作分配给协作者并行完成子任务。然而GUI智能体之间的并行协作很少受到关注。为弥合这一空白,我们提出ParaGUIBench,据我们所知是首个专门面向多个GUI智能体在独立桌面实例上并行执行与协作的基准。它由三部分组成:带共享文件系统的多设备Docker基础设施;涵盖六个任务类别的233个任务数据集;以及包含步骤缩减比与词元开销等效率指标的评估系统。我们进一步提出ParaGUI,一个规划者-执行者式智能体,将GUI任务分解并把子任务派发给运行在独立桌面实例上的并发执行者。在ParaGUIBench上,ParaGUI达到46.4%的成功率,比最强串行基线(Claude Sonnet 4.6)高12.9分,同时使用的步骤约为其一半、词元不到其一半。这些结果表明,并行执行能够同时提升可分解长程GUI任务的成功率与效率,是一个值得进一步研究的方向。
