论文

迎接挑战:艰巨的代理任务

Running the Gauntlet: Hard Agentic Tasks

智能体系统Agent任务评测

摘要

随着代理系统不断发展并在现实场景中广泛部署,人们越来越需要如实地评估其功能。然而,当前的基准测试通常建立在具有相对简单任务的流行应用程序上,并且专注于一组狭窄的功能,而忽略了更广泛的维度,导致现代代理的性能饱和并且无法探究其局限性。为此,我们引入了 GauntletBench,这是一个基于 Web 的基准,用于在具有挑战性的场景中评估智能体泛化能力,重点关注三个未充分开发的功能(时间感知、图形理解和 3D 推理),涵盖五个较少覆盖的专业应用程序(视频编辑器、工作流生成器、3D 建模器、飞行分析器和电路设计器),每个应用程序都有 27 个视觉密集型任务(总共 135 个)。我们的基准测试提供了一个模块化管道,其中包括与开源和闭源代理框架兼容的环境、受控的基于 Web 的应用程序、结构良好的任务套件以及具有多种指标的自动评估引擎。与普遍的预期相反,我们的实证结果表明,前沿代理系统仍远未达到人类水平的表现。即使是最先进的智能体在我们的 GauntletBench 上也只能达到 28.2% 的成功率,凸显了这些被忽视的能力和泛化能力的局限性。相比之下,非专家人类注释者在我们具有挑战性但可行的任务上取得了超过 80% 的成功,揭示了当前代理能力与复杂的现实场景所需的能力之间的巨大差距。