论文

超越顺序交互:面向GUI智能体并行执行与协作的基准测试

Beyond Sequential Interaction: Benchmarking Parallel Execution and Coordination for GUI Agents

模型评测智能体系统Agent任务评测基准与评测资源长程任务评测

摘要

图形用户界面(GUI)智能体是由大型多模态模型(LMM)驱动的系统。它们感知屏幕状态,并通过在桌面和移动设备上点击、键入、滚动等GUI操作来执行用户指令。然而,当前智能体在长程任务上扩展性不佳:每次动作都需要代价高昂的LMM推理,且性能随上下文增长而下降。人类会将这类工作分配给协作者并行完成子任务。然而GUI智能体之间的并行协作很少受到关注。为弥合这一空白,我们提出ParaGUIBench,据我们所知是首个专门面向多个GUI智能体在独立桌面实例上并行执行与协作的基准。它由三部分组成:带共享文件系统的多设备Docker基础设施;涵盖六个任务类别的233个任务数据集;以及包含步骤缩减比与词元开销等效率指标的评估系统。我们进一步提出ParaGUI,一个规划者-执行者式智能体,将GUI任务分解并把子任务派发给运行在独立桌面实例上的并发执行者。在ParaGUIBench上,ParaGUI达到46.4%的成功率,比最强串行基线(Claude Sonnet 4.6)高12.9分,同时使用的步骤约为其一半、词元不到其一半。这些结果表明,并行执行能够同时提升可分解长程GUI任务的成功率与效率,是一个值得进一步研究的方向。

超越顺序交互:面向GUI智能体并行执行与协作的基准测试:论文配图
图 2:ParaGUI 规划器 - 工作器架构。每一轮,规划器都会向并行运行的最多 NN 个 GUI 工作人员分派一批子任务,汇总它们返回的摘要,并决定是否分派另一轮或终止。