论文

WindowsWorld:专业跨应用环境中自主GUI智能体的以流程为中心的基准

WindowsWorld: A Process-Centric Benchmark of Autonomous GUI Agents in Professional Cross-Application Environments

智能体系统Agent任务评测长程任务评测

摘要

尽管GUI智能体已在OSWorld等常见计算机操作任务中展现出令人印象深刻的能力,现有基准主要聚焦于孤立的单应用任务。这忽视了现实世界的一个关键需求:跨多个应用协调以完成复杂的职业特定工作流程。为弥合这一差距,我们提出一个面向跨应用工作流的计算机操作基准WindowsWorld,旨在系统性地评估GUI智能体在映射真实职业活动的复杂多步任务上的表现。我们的方法使用由16种职业驱动的多智能体框架生成带中间检查的四个难度级别任务,随后经人工审核精炼,并在模拟环境中执行。所得基准包含181个任务,横跨17个常见桌面应用,平均每个任务5.0个子目标,其中78%天然涉及多应用。领先大模型与智能体的实验结果表明:1)所有计算机操作智能体在多应用任务上表现糟糕(成功率<21%),远低于简单单应用任务的表现;2)它们在需要跨3个及以上应用进行条件判断和推理的任务上大多失败,卡在早期子目标上;3)执行效率低下,任务往往在远超人类步骤限制后仍告失败。代码、基准数据和评估资源可在github.com/HITsz-TMG/WindowsWorld获取。

WindowsWorld:专业跨应用环境中自主GUI智能体的以流程为中心的基准:论文配图
图 11:pyautogui 和本地输入法编辑器 (IME) 之间的交互仍然存在技术挑战,其中中文输入配置经常与自动击键发生冲突。此外,模型经常难以使用键盘快捷键来跨搜索界面同步内容。这些问题突出表明代理需要处理随机 GUI 异常,例如 IME 弹出窗口和无意的鼠标触发。加强代理对这些环境不一致的适应能力对于在复杂的桌面环境中保持轨迹稳定性至关重要。