论文
AIRA_2:突破AI研究智能体的性能瓶颈
AIRA_2: Overcoming Bottlenecks in AI Research Agents
摘要
现有研究已经确定了人工智能研究代理的三个结构性能瓶颈:(1)同步单GPU执行限制了样本吞吐量,限制了搜索的优势; (2) 泛化差距,其中基于验证的选择导致性能在扩展搜索范围内下降; (3) 固定、单轮 LLM 算子的有限能力限制了搜索性能。我们引入了 AIRA$_2$,它通过三种架构选择解决了这些瓶颈:异步多 GPU 工作池,可线性增加实验吞吐量;隐藏的一致评估协议,可提供可靠的评估信号;和 ReAct 代理,动态调整其操作范围并进行交互调试。在 MLE-bench-30 上,AIRA$_2$ 在 24 小时内达到了 71.8% 的平均百分位排名 - 超过了之前最好的 69.9% - 并在 72 小时内稳步提高到 76.0%。消融研究表明,每个组件都是必要的,并且先前工作中报告的“过度拟合”是由评估噪声而不是真实的数据记忆驱动的。
