论文

AIRA_2:突破AI研究智能体的性能瓶颈

AIRA_2: Overcoming Bottlenecks in AI Research Agents

智能体系统Agent 架构与控制循环

摘要

现有研究已经确定了人工智能研究代理的三个结构性能瓶颈:(1)同步单GPU执行限制了样本吞吐量,限制了搜索的优势; (2) 泛化差距,其中基于验证的选择导致性能在扩展搜索范围内下降; (3) 固定、单轮 LLM 算子的有限能力限制了搜索性能。我们引入了 AIRA$_2$,它通过三种架构选择解决了这些瓶颈:异步多 GPU 工作池,可线性增加实验吞吐量;隐藏的一致评估协议,可提供可靠的评估信号;和 ReAct 代理,动态调整其操作范围并进行交互调试。在 MLE-bench-30 上,AIRA$_2$ 在 24 小时内达到了 71.8% 的平均百分位排名 - 超过了之前最好的 69.9% - 并在 72 小时内稳步提高到 76.0%。消融研究表明,每个组件都是必要的,并且先前工作中报告的“过度拟合”是由评估噪声而不是真实的数据记忆驱动的。

AIRA_2:突破AI研究智能体的性能瓶颈:论文配图
(a) 计算效率(性能与 GPU 时间)。 AIRA2{}_{\mbox{2}} 与 1 与 8 GPU 的比较(按总计算归一化)。虽然 8-GPU 设置会产生初始探索成本(GPU 小时),但它建立了多样化的群体,可产生卓越的长期性能,在 144 GPU 小时时,差距扩大到 7.5 个百分点。(b) 大规模搜索策略(性能与挂起时间)。我们将 AIRA2{}_{\mbox{2}} (8-GPU Evo) 与 No-Evo (Best-of-K) 并行基线(8-GPU,无进化)和单 GPU 基线进行比较。没有信息共享的并行性(Best-of-K)会提前饱和,收敛到与单 GPU 代理相同的最终性能。图 3:计算分析。我们分析了并行资源对 AIRA2{}_{\mbox{2}} 的影响,证明并行计算的有效使用需要额外的资源和进化机制来利用它们。