论文
大语言模型智能体能发现新事物吗?评估机器学习工程任务中的创造力
Can LLM Agents Discover? Evaluating Creativity on ML Engineering Tasks
摘要
最近的人工智能系统承诺自主科学发现,声称能够发现算法并产生研究论文,但了解它们是否表现出创造力以及产生新颖且有用的解决方案的能力仍然是一个悬而未决的问题。我们提出了一个框架,用于使用 ML 工程任务作为测试平台,通过三个维度来评估多轮 LLM 研究代理的创造力:P-创造力(心理新颖性:相对于代理在一次运行中自己的先前解决方案的新颖性)、H-创造力(历史新颖性:相对于人类解决方案的语料库的新颖性)和有用性(任务绩效)。通过在 MLE-Bench 的 10 个 Kaggle 式机器学习任务上评估两个代理框架 AIDE 和 AIRA-Dojo,我们开发了一个 LLM-as-a-Judge 管道,并验证了其与人类创造力判断的强相关性,为大规模 P-Creativity 评估提供了可靠的自动化指标。将此管道应用于智能体轨迹,我们发现:(1)所有智能体在从探索过渡到利用时都表现出下降的 P 创造力; (2) LLM比获奖者表现出更高的 H 创造力,但表现却较低。我们的研究结果表明,当前的智能体可以探索解决方案空间的新颖区域,但缺乏将这种新颖性转化为改进的任务绩效的能力。