论文
TUA-Bench:通用终端使用代理的基准
TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents
摘要
随着 大语言模型 和Harness框架的不断发展,在终端中操作的代理越来越有能力执行除编码之外的更广泛的通用计算机使用任务。然而,现有的基准测试并没有充分评估通用终端计算机使用代理(TUA):通用计算机使用基准测试主要针对图形用户界面(GUI),而基于终端的基准测试则主要强调历史上以 shell 为中心的技术和以编程为中心的工作流程。我们推出 TUA-Bench,这是一个针对终端使用代理的通用基准测试。 TUA-Bench 包括 5 个任务系列中的 120 个现实世界任务,涵盖日常数字活动(包括文档编辑、电子邮件管理和实时网络信息搜索)以及与需要专门软件的博士级领域专家共同设计的科学和工程工作流程。这种广度将 TUA-Bench 与之前以 shell 为中心或特定领域的基准测试区分开来。每个任务都是手动设计的,使用确定性设置脚本在真实终端中运行,并通过基于执行的评分协议进行评估。我们发现最强的前沿代理 Claude Code 具有 Claude Opus 4.8 最大推理能力,整体性能达到 65.8%,两个轨道之间存在很大差距。通过对终端使用能力进行广泛而现实的评估,TUA-Bench 旨在加速从狭隘的、特定于任务的助手向能够在不同数字环境中可靠运行的通用代理的转变。