论文
效率在自主研究中举足轻重
Efficiency Matters in Autonomous Research
摘要
AI驱动的自主研究(AR)系统在广泛任务上的效果日益提升。然而其性能仍主要以最终结果的质量来评估。本文论证,解搜索过程的效率是一个同样重要却常被忽视的性能维度。强大的AR系统不仅应产出高质量结果,还应以尽可能小的预算达到这些结果。随着AR从数学、编程等验证成本低廉的领域扩展到解评估可能需要昂贵物理实验的真实科学场景,搜索效率将变得越来越重要。为刻画这一维度,我们提出除最终结果质量外,还使用Pareto前沿的曲线下面积(AUC)来评估AR系统。我们在十二个系统优化任务上比较了多个搜索算法家族,包括爬山法、束搜索、树搜索和进化搜索。我们发现没有哪一种搜索结构始终最有效率。我们还表明,搜索效率与最终结果质量是两个不同的性能维度:最终取得最佳结果的方法可能改进缓慢,并在达到该结果之前消耗多得多的评估预算。由于最有效的搜索策略通常无法预先知晓,我们提出一种称为fluid search的自适应程序,它使用组合老虎机(portfolio bandit)在一组搜索进程构成的森林中动态分配固定评估预算。在所评估的任务上,fluid search实现了最高的整体搜索效率,接近于预先为每个任务指定最佳搜索结构的逐任务预言机的性能。