论文
TerminalWorld:在真实终端任务上对智能体进行基准评测
TerminalWorld: Benchmarking Agents on Real-World Terminal Tasks
摘要
我们提出TerminalWorld,一个可扩展的数据引擎,能从“野生”终端录制中自动逆向工程出高保真评估任务。该引擎处理80,870条终端录制,产出包含1,530个经校验任务的全量基准,覆盖18个真实场景类别,从简短日常操作到超过50步的工作流,涉及1,280个不同命令。在此基础上,我们精选出200个具代表性、经人工审核任务的Verified子集。在TerminalWorld-Verified上对八个前沿模型与六个智能体的全面评测显示,现有系统仍难以应对真实终端工作流,最高通过率仅为62.5%。此外,TerminalWorld捕捉的真实终端能力与现有专家策划基准(如Terminal-Bench)所测不同,其得分仅呈弱相关(Pearson r=0.20)。自动化引擎使TerminalWorld在构造上即真实且可扩展,能够随开发者实践的演进在真实终端环境中评估智能体。数据与代码见https://github.com/EuniAI/TerminalWorld。
