论文

超越最终分数:面向长周期AI研发智能体的系统性评估

Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development

智能体系统上下文与知识记忆Agent任务评测Agent记忆长程任务评测

摘要

自主智能体通过长周期实验来改进模型、系统和其他技术产物的能力日益增强。然而,要理解这种能力的现状,评估必须超越最终分数——最终分数既无法揭示进展在何处获得或损失,也无法表明积累的经验能否改进后续决策。因此,我们基于一个新框架对七个前沿模型在36个长周期任务上进行了系统性评估,该框架使用基于规则的指标,通过方案构建(Solution Framing)、执行(Execution)与反馈控制(Feedback Control)刻画单次运行内的行为,并通过受控比较评估任务内和任务间的经验复用。结果表明,当前的智能体更像工程优化器而非完全自主的研究者:它们能够制定并实施实用的解决方案,但其性能在不同运行之间差异显著,其最强的方案主要是对既有技术的改编或组合,真正的方法学新颖性仍然罕见。详细分析揭示,观察到的性能受多种因素影响,包括相似最终结果背后不同的过程瓶颈、可能帮助也可能误导后续决策的经验复用,以及影响性能稳定性的harness(运行框架)设计。这些发现为改进模型训练、推理时策略、经验管理和harness设计提供了具体方向。

超越最终分数:面向长周期AI研发智能体的系统性评估:论文配图
图1:用于解释自动研究行为的分析视图。过程视图涵盖方案构思(Solution Framing,C1)、执行(C2)和反馈控制(C3)。经验视图使用受控比较来衡量积累的经验如何在任务内和任务间设置中影响后续决策。