论文
超越最终分数:面向长周期AI研发智能体的系统性评估
Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development
摘要
自主智能体通过长周期实验来改进模型、系统和其他技术产物的能力日益增强。然而,要理解这种能力的现状,评估必须超越最终分数——最终分数既无法揭示进展在何处获得或损失,也无法表明积累的经验能否改进后续决策。因此,我们基于一个新框架对七个前沿模型在36个长周期任务上进行了系统性评估,该框架使用基于规则的指标,通过方案构建(Solution Framing)、执行(Execution)与反馈控制(Feedback Control)刻画单次运行内的行为,并通过受控比较评估任务内和任务间的经验复用。结果表明,当前的智能体更像工程优化器而非完全自主的研究者:它们能够制定并实施实用的解决方案,但其性能在不同运行之间差异显著,其最强的方案主要是对既有技术的改编或组合,真正的方法学新颖性仍然罕见。详细分析揭示,观察到的性能受多种因素影响,包括相似最终结果背后不同的过程瓶颈、可能帮助也可能误导后续决策的经验复用,以及影响性能稳定性的harness(运行框架)设计。这些发现为改进模型训练、推理时策略、经验管理和harness设计提供了具体方向。
