论文

不要赌博,要GAMBLe:AI驱动研究系统的分析框架

Don't Gamble, GAMBLe: An Analytical Framework for AI-Driven Research Systems

模型评测评测方法与指标

摘要

人工智能驱动的研究系统(ADRS)——将大语言模型与自动评估相结合以发现算法、证明和设计的系统——正在跨领域进行优化和采用,但分析它们的工具却没有跟上步伐。 ADRS 性能取决于组件交互,而这些交互我们知之甚少,探索成本高昂,并且(正如我们所示)标准收敛保证无法很好地捕获这些交互。这些保证依赖于我们正式制定的 ADRS 流程中不成立的结构性假设。我们引入了 GAMBLe,这是一个将 ADRS 行为分解为四个参数(生成器 $G$、评估器 $\mathcal{A}$、发现机制 $\mathcal{M}$、预算 $B$)和一个组合对象(有效景观 $L_{\text{eff}} = \mathcal{A} \circ G$)的框架,它揭示了不同的生成器-评估器对会导致结构上不同的每个问题优化景观。我们在 760 多次重复运行(> 46,000 次迭代)上运行了该框架,涵盖从单一 LLM 到动态自适应集成的生成器、从贪婪选择到共同进化元搜索的机制,以及评估器范围从连续评分到悬崖函数的三个 NP 难题。实验表明,生成器或机制没有完全排序:前沿模型的性能可能低于开源替代方案,而最简单的机制有时优于最先进的元搜索。结果表明,即使在有限的预算(每次运行 60 次迭代)下,正确的组件选择也可以将性能提高 13-67%,并将搜索效率提高 6-39 倍。

不要赌博,要GAMBLe:AI驱动研究系统的分析框架:论文配图
图 6:G×ℳG\times\mathcal{M} 覆盖矩阵显示 P1(左)与 P11(右)上达到得分 ≥99\geq 99 的运行分数。每个单元格都显示在总运行中达到接近最佳的运行。 P1 在生成器和机制之间表现出丰富的差异(第 3.2 节); P11 显示所有 22 种测试配置中的通用零。灰色单元格表示未经测试的组合。按系列分组的发电机; eb1 变体单独显示(由于与可用性相关的覆盖范围稀疏而排除了 eb1-pro)。