论文
FML-bench:搜索动力学视角下的人工智能研究代理策略的对照研究
FML-bench: A Controlled Study of AI Research Agent Strategies from the Perspective of Search Dynamics
摘要
人工智能研究代理通过自动化假设生成、实验和经验细化来加速机器学习研究。现有的代理策略范围从贪婪的爬山到树搜索和进化优化,但哪些策略选择驱动性能仍不清楚。回答这个问题需要一个基准,将代理策略(例如,搜索拓扑)与执行基础设施(例如,代码编辑器)分开,以便性能差异归因于策略而不是基础设施,并提供最终分数之外的流程级指标来分析探索行为。现有基准提供的支持有限。我们提出了 FML-Bench,这是跨 10 个领域的 18 项基本 ML 研究任务的基准,它将代理策略与执行基础设施分开,并定义了 12 个流程级行为指标。评估六个代表性代理,我们发现:(1)策略复杂性本身并不能保证强大的性能:一个简单的贪婪爬山者几乎与性能最好的树搜索代理相匹配,两者都远远高于其余代理; (2)我们的分析表明,这种模式与改进机会结构有关:当机会密集时,贪婪搜索往往更有效,而当机会稀疏时,树搜索和进化策略往往更有效;基于这种洞察力的自适应代理在检测到改进停滞时切换到更广泛的探索,并优于其他六个代理,为这一观察提供了初步支持; (3)过程级分析表明,早期收敛和定向探索与最终性能显着相关,而解决方案多样性和计算成本则不然。我们的基准测试位于:https://github.com/qrzou/FML-bench。