论文
DeskCraft:专业工作流与人机协同中桌面智能体基准
DeskCraft: Benchmarking Desktop Agents on Professional Workflows and Human-in-the-Loop Collaboration
摘要
专业创意和工程软件中的现实世界专业桌面工作流程会长期展开,通常需要人机协作,其中代理主动寻求必要的信息,而用户随着任务的进展提供额外的说明、澄清、反馈或更正。然而,现有的桌面 GUI 基准测试大多将此设置简化为简短、简化的任务,并预先提供所有用户指令。为了解决这个问题,我们推出了 DeskCraft,这是一个桌面 GUI 基准测试,针对长期创意和工程工作流程以及主动的人工协作。 DeskCraft 将任务组织为多级难度分类,其中长期任务需要 50 多个执行步骤,并涵盖跨设计、视频、音频和 3D 创作的专业创意软件。此外,DeskCraft 将人类与代理的协作正式化为涵盖轮中和轮后交换的交互协议。轮中交互捕获不确定性下代理发起的澄清和执行过程中用户发起的中断,而轮后交互则在代理发出完成信号后容纳用户驱动的反馈,共同跨越现实协作模式的整个空间。我们在 538 项任务上评估了 18 个专有和开源代理,发现 GPT-5.4 在标准任务上达到了 31.6%,在交互式任务上达到了 27.6%。进一步的分析揭示了长期工作流程交付和主动澄清方面持续存在的失败。我们将在 https://github.com/mrwwk/DeskCraft 开源所有评估代码、任务和数据。
