论文
Workflow-GYM:迈向真实专业领域中计算机使用智能体任务的长程评估
Workflow-GYM: Towards Long-Horizon Evaluation of Computer-use Agentic tasks in Real-World Professional Fields
摘要
近年来,人工智能代理迅速发展,能够处理日益复杂的现实世界任务。然而,现有的基准很少评估代理是否可以操作图形用户界面来完成跨不同领域的长期、高价值的专业工作流程。目前的GUI基准测试仍然主要关注通用软件、相对简单的应用程序和短期任务,很大程度上不知道现代代理是否可以按照用户指令自主操作特定领域的专业软件并以端到端的方式完成具有经济价值的工作。为了弥补这一差距,我们引入了 Workflow-GYM,这是一个以专业领域和专业软件环境为中心的长期 GUI 任务的基准。通过对最先进模型的大量实验,我们发现即使是最强大的模型也只能达到略高于 30% 的成功率,这凸显出专业的长期 GUI 工作流程对于当前的 GUI 代理来说仍然具有高度挑战性。进一步的分析表明,当前的代理很难保持长期工作流程的一致性,经常出现工作流程阶段遗漏、错误传播、目标漂移以及对专业软件环境理解不足的情况。我们的研究结果为了解当前代理系统的局限性提供了重要见解,并为下一代 GUI 代理研究提出了关键方向。
