论文

Workspace-Bench 1.0:在大规模文件依赖的工作区任务上评测AI智能体

Workspace-Bench 1.0: Benchmarking AI Agents on Workspace Tasks with Large-Scale File Dependencies

智能体系统Agent任务评测

摘要

工作区学习要求AI智能体识别、推理、利用并更新工作者工作区中异构文件间的显式与隐式依赖,从而有效完成常规与高级任务。尽管重要,既有基准大多在预指定或合成文件、有限真实依赖上评估智能体,工作区级评估仍属空白。为此我们提出Workspace-Bench:面向涉及大规模文件依赖的工作区学习的智能体评测基准。我们以5个工作者画像、74种文件类型、20,476个文件(最高20GB)构建真实工作区,精选388个任务——每个任务自带文件依赖图——以7,399条总量规评估,要求跨文件检索、上下文推理与自适应决策。我们另提供Workspace-Bench-Lite:100任务子集,保持分布的同时把评估成本降约70%。我们评估4个流行智能体harness与7个基础模型。结果显示当前智能体距可靠的工作区学习尚远:最佳仅约60%,显著低于人类的80.7%,智能体平均仅43.3%。

Workspace-Bench 1.0:在大规模文件依赖的工作区任务上评测AI智能体
图 1:Workspace-Bench 精简版的性能。我们评估了四种工具(ClaudeCode、DeepAgent、Hermes 和 OpenClaw)以及七名骨干大语言模型。排名前三的配置均将 Opus-4.7 与不同的线束配对,而排名较低的组合则在线束和大语言模型之间表现出巨大的差异。