论文

TerminalWorld:在真实终端任务上对智能体进行基准评测

TerminalWorld: Benchmarking Agents on Real-World Terminal Tasks

智能体系统Agent任务评测长程任务评测

摘要

我们提出TerminalWorld,一个可扩展的数据引擎,能从“野生”终端录制中自动逆向工程出高保真评估任务。该引擎处理80,870条终端录制,产出包含1,530个经校验任务的全量基准,覆盖18个真实场景类别,从简短日常操作到超过50步的工作流,涉及1,280个不同命令。在此基础上,我们精选出200个具代表性、经人工审核任务的Verified子集。在TerminalWorld-Verified上对八个前沿模型与六个智能体的全面评测显示,现有系统仍难以应对真实终端工作流,最高通过率仅为62.5%。此外,TerminalWorld捕捉的真实终端能力与现有专家策划基准(如Terminal-Bench)所测不同,其得分仅呈弱相关(Pearson r=0.20)。自动化引擎使TerminalWorld在构造上即真实且可扩展,能够随开发者实践的演进在真实终端环境中评估智能体。数据与代码见https://github.com/EuniAI/TerminalWorld。

TerminalWorld:在真实终端任务上对智能体进行基准评测:论文配图
图 1:TerminalWorld 管道的概述。我们的数据引擎通过四个关键阶段来自动化终端任务合成:(1)收集人类记录收获野外开发人员操作; (2) 综合终端任务提炼出面向结果的任务指令和干净的参考解决方案; (3) 复制可执行环境创建并完善一个隔离的 Docker 容器来重放核心工作流程; (4) 生成测试套件利用基于试验的细化循环在 Docker 容器内生成和校准测试套件。