论文
Workspace-Bench 1.0:在大规模文件依赖的工作区任务上评测AI智能体
Workspace-Bench 1.0: Benchmarking AI Agents on Workspace Tasks with Large-Scale File Dependencies
摘要
工作区学习要求AI智能体识别、推理、利用并更新工作者工作区中异构文件间的显式与隐式依赖,从而有效完成常规与高级任务。尽管重要,既有基准大多在预指定或合成文件、有限真实依赖上评估智能体,工作区级评估仍属空白。为此我们提出Workspace-Bench:面向涉及大规模文件依赖的工作区学习的智能体评测基准。我们以5个工作者画像、74种文件类型、20,476个文件(最高20GB)构建真实工作区,精选388个任务——每个任务自带文件依赖图——以7,399条总量规评估,要求跨文件检索、上下文推理与自适应决策。我们另提供Workspace-Bench-Lite:100任务子集,保持分布的同时把评估成本降约70%。我们评估4个流行智能体harness与7个基础模型。结果显示当前智能体距可靠的工作区学习尚远:最佳仅约60%,显著低于人类的80.7%,智能体平均仅43.3%。
