论文

GTA-2:从原子工具使用到开放式工作流程的通用工具代理基准测试

GTA-2: Benchmarking General Tool Agents from Atomic Tool-Use to Open-Ended Workflows

智能体系统Agent任务评测

摘要

通用代理的开发需要从执行简单指令转变为完成复杂的、现实世界的生产力工作流程。然而,当前的工具使用基准仍然与现实世界的要求不一致,依赖于人工智能生成的查询、虚拟工具和有限的系统级协调。为了解决这个问题,我们提出了 GTA-2,这是通用工具代理 (GTA) 的分层基准,涵盖原子工具使用和开放式工作流程。它建立在现实世界的真实性之上,利用真实的用户查询、部署的工具和多模式上下文。 (i) GTA-Atomic,继承自我们之前的 GTA 基准,评估短期、封闭式工具使用精度。 (ii) GTA-工作流程引入了长期、开放式任务,以实现现实的端到端完成。为了评估开放式可交付成果,我们提出了一种基于检查点的递归评估机制,将目标分解为可验证的子目标,从而能够对模型功能和代理执行框架(即执行工具)进行统一评估。实验揭示了明显的能力悬崖:虽然前沿模型已经在原子任务上陷入困境(低于 50%),但它们在工作流程上很大程度上失败了,顶级模型仅取得了 14.39% 的成功。进一步的分析表明,检查点引导的反馈可以提高性能,而 Manus 和 OpenClaw 等先进框架则可以显着增强工作流程的完成度,凸显了超越底层模型能力的执行Harness设计的重要性。这些发现为开发可靠的个人和专业助理提供了指导。数据集和代码将在 https://github.com/open-compass/GTA 上提供。