论文

AutoLab:前沿模型能解决长程自动研究与工程问题吗?

AutoLab: Can Frontier Models Solve Long-Horizon Auto Research and Engineering Tasks?

智能体系统Agent任务评测

摘要

科学和工程进步从根本上来说是一个长期的迭代过程:提出改变、进行实验、测量结果和不断完善工件。然而,现有的前沿模型基准主要评估单轮响应或短视野智能体轨迹,未能捕捉到长期持续迭代改进的挑战。为了弥补这一差距,我们推出了 AutoLab,这是一种超长视野闭环优化的新基准。 AutoLab 包含 36 个由专家策划的真实任务,涵盖四个不同的领域:系统优化、谜题与挑战、模型开发和 CUDA 内核优化。每项任务都以正确但故意次优的基线开始,并要求代理在严格的挂钟预算内改进它。对 17 个最先进模型的评估表明,成功的主要预测因素不是智能体最初尝试的质量,而是其坚持反复进行基准测试、编辑和纳入经验反馈。虽然 claude-opus-4.6 表现出强大的长期优化能力,但大多数前沿模型,包括几个专有模型,要么提前终止,要么耗尽预算,进展甚微。这些结果强调了自主代理中时间意识和持续迭代的重要性。我们开源完整的基准、评估工具和任务工件,以加速对真正有能力的长期代理的研究。

AutoLab:前沿模型能解决长程自动研究与工程问题吗?:论文配图
图 1:AutoLab 对跨越 4 个类别的 36 个任务的前沿模型进行了基准测试,此处针对 11 个提供商旗舰产品(每个提供商一个模型)。顶部:按 Avg@3 从左到右排序的模型(实心条);半透明延伸达到Best@3。底部:四个玫瑰图表,每个类别一个,其中每个花瓣的长度是该模型在该类别中的 Avg@3。 claude-opus-4.6 在所有四个类别和总体排名中均领先;亚军按类别轮流获得。