论文
多代理计算机使用
Multi-Agent Computer Use
摘要
如今,计算机使用代理 (CUA) 主要部署为单个串行代理。对于受益于任务分解、并行执行和基于新信息的一致重新规划的复杂长期任务来说,此设置并不是最佳选择。在本文中,我们认为我们应该转向评估和构建多代理计算机使用(MACU)系统。这些系统强调规划和并行执行,缓解了单代理 CUA 的许多缺点。我们提出了一种通用的多代理设置,其中管理器模型将计算机使用任务分解为有向无环图(DAG),编码子代理的相关依赖关系和目标。在每次迭代中,管理器都会调度并行的 CUA 子代理来执行 DAG 就绪边界上的节点,并在子代理收到新发现时不断修改 DAG(添加、取消或重写节点)。这种设计将计算机使用的部分可观察环境视为首要挑战:下游代理可能无法重新观察的信息被保留并通过管理器和 DAG 结构向前传递。我们证明,MACU 在桌面 (OSWorld) 和 Web 导航(Online-Mind2Web、WebTailBench、Odysseys)基准上始终比强大的单代理基线提高了 3.4-25.5%$,表现出更有利的测试时间扩展,并解决了单代理 CUA 陷入困境的复杂长期任务。在 Odysseys(一种长视野 Web 导航基准)上,MACU 将平均任务完成挂钟时间提高了 ${\sim} 1.5 \times$,展示了其在加速传统上缓慢的 CUA 管道方面的功效。我们的研究结果强调,多代理协调是扩展计算机使用代理的一个有前途的轴,可以更长时间、更有效地高效工作。我们在 https://jykoh.com/multi-agent-computer-use 上发布了所有代码和交互式可视化。