论文

DeskCraft:专业工作流与人机协同中桌面智能体基准

DeskCraft: Benchmarking Desktop Agents on Professional Workflows and Human-in-the-Loop Collaboration

智能体系统Agent任务评测长程任务评测

摘要

专业创意和工程软件中的现实世界专业桌面工作流程会长期展开,通常需要人机协作,其中代理主动寻求必要的信息,而用户随着任务的进展提供额外的说明、澄清、反馈或更正。然而,现有的桌面 GUI 基准测试大多将此设置简化为简短、简化的任务,并预先提供所有用户指令。为了解决这个问题,我们推出了 DeskCraft,这是一个桌面 GUI 基准测试,针对长期创意和工程工作流程以及主动的人工协作。 DeskCraft 将任务组织为多级难度分类,其中长期任务需要 50 多个执行步骤,并涵盖跨设计、视频、音频和 3D 创作的专业创意软件。此外,DeskCraft 将人类与代理的协作正式化为涵盖轮中和轮后交换的交互协议。轮中交互捕获不确定性下代理发起的澄清和执行过程中用户发起的中断,而轮后交互则在代理发出完成信号后容纳用户驱动的反馈,共同跨越现实协作模式的整个空间。我们在 538 项任务上评估了 18 个专有和开源代理,发现 GPT-5.4 在标准任务上达到了 31.6%,在交互式任务上达到了 27.6%。进一步的分析揭示了长期工作流程交付和主动澄清方面持续存在的失败。我们将在 https://github.com/mrwwk/DeskCraft 开源所有评估代码、任务和数据。

DeskCraft:专业工作流与人机协同中桌面智能体基准:论文配图
图 1:DeskCraft 概述。左图:386 个标准任务分层为 L1 原子级、L2 组合级和 L3 长水平级别,其中 L3 是从真实交付管道中提取的。中:由三个可组合触发器(步数计数、代理查询、代理完成)驱动的 152 个交互式任务,这些触发器通过人工与代理协作来发展任务。右:跨 5 个领域的 11 个应用程序,包括专业软件(例如 Blender、Kdenlive),与之前的基准测试相比,它们需要更精细的空间精度、更密集的 UI 和更深入的领域知识。