论文

AgencyBench:在百万 token 真实场景中测试自主智能体的前沿能力

AgencyBench: Benchmarking the Frontiers of Autonomous Agents in 1M-Token Real-World Contexts

智能体系统AI 基础设施Agent任务评测Sandbox长程任务评测Agent Sandbox

摘要

基于大语言模型(LLM)的自主智能体展现出为经济生产做出实质贡献的多方面能力。然而,现有基准仍聚焦单一智能体能力,无法覆盖长程真实场景。此外,对现实任务依赖人在回路反馈造成可扩展性瓶颈,阻碍自动化的 rollout 收集与评估。为弥合这一缺口,我们提出 AgencyBench,一个源自日常 AI 使用的综合基准,跨 32 个真实场景评估 6 项核心智能体能力,包含 138 个带具体查询、交付物与评分细则的任务。这些场景平均需要 90 次工具调用、100 万 token 与数小时执行时间才能解决。为实现自动评估,我们采用用户模拟智能体提供迭代反馈,并用 Docker 沙箱开展基于评分细则的视觉与功能评估。实验显示,闭源模型显著优于开源模型(48.4% 对 32.1%)。进一步分析揭示各模型在资源效率、反馈驱动的自我修正以及特定工具使用偏好上差异显著。最后,我们考察智能体脚手架的影响,观察到专有模型在其原生生态中表现更优(例如 Claude-4.5-Opus 经 Claude-Agent-SDK),而开源模型呈现不同的性能峰值,提示可针对特定执行框架优化。AgencyBench 是下一代智能体的关键试验台,凸显了模型架构与智能体框架协同优化的必要性。我们相信这项工作揭示了自主智能体的未来方向,并已在 https://github.com/GAIR-NLP/AgencyBench 发布完整基准与评估工具包。

AgencyBench:在百万 token 真实场景中测试自主智能体的前沿能力
图2:AgencyBench 的 Rollout 生成与评估流程。Rollout 生成在 workspace(工作区)内进行,智能体在其中接收任务查询与交付物,通过与环境的多轮交互(例如工具执行结果与来自用户模拟智能体的反馈)完成任务。任务完成后,交付物被同步到 Docker 沙箱以执行操作(例如 UI 动作),所产生的工件(artifacts)随后被转移到 eval-space,依据任务量规(rubrics)由基于规则或基于 LLM 的评判者打分(0 − 10 0-10)。