论文
衡量前沿大语言模型在自动化研究中的创造力
Measuring the Creativity of Frontier LLMs in Automated Research
摘要
前沿大语言模型越来越有能力进行自动化研究,但他们在这方面的创造力尚未得到系统评估。在本文中,我们提出了一套衡量创造力的指标,从价值和新颖性两个维度进行评估。价值评估每个提出的想法是否有用,而新颖性从三个角度评估:相同的想法以前是否出现过(精确匹配P-新颖性),是否探索了先前未探索的变量或变量组合(变量级P-新颖性),以及该想法是否直接遵循检索到的外部知识或背离它(H-新颖性)。我们的评估表明,这些模型在大多数创造力指标上取得了相对相似的分数,但在可变水平 P-新颖性方面存在很大差异,这反映了研究空间探索的广度。进一步的相关性和想法层面的绩效分析表明,可变层面的 P-新颖性是与研究绩效最密切相关的创造力维度。