论文

评估大语言模型的创造力:测试、局限与新前沿

Assessing the Creativity of Large Language Models: Testing, Limits, and New Frontiers

模型评测评测方法与指标

摘要

测量大语言模型(LLM)的创造力,对于设计能够提升创造力的方法以及加深对这一能力的科学理解都至关重要。为此,近年来对LLM施测人类创造力测验的做法已很普遍。尽管这些测验提供了一种便捷且完全自动化的“创造力”打分方式,但其作为机器创造力度量的效度尚未确立,而且这些测验本身作为人类创造力预测因子的效度也很有限。为解决这一问题,我们开展了首个大规模系统性研究,评估人类创造力测验在预测LLM创造性成就方面的有效性,覆盖三个目标构念:创意写作、发散性思维和科学构思。我们发现,发散联想任务(DAT)和条件DAT分别是创意写作与发散性思维的最佳预测因子,但测验有效性随构念显著变化,没有任何单一测验能对所有构念都预测良好。此外,与流行看法相反,没有任何现有测验能可靠预测科学构思能力。受此问题驱动,我们提出发散远距联想测验(DRAT),一种在单一工具中同时评估聚合与发散思维的词汇空间测验。DRAT是首个也是唯一一个能显著预测LLM科学构思能力的创造力测验,并在主要设计选择上表现出稳健性。此外,DRAT的性能增益无法从发散联想任务与远距联想测验的任何线性组合中复原,这表明在同一测验中同时评估发散与聚合思维,是可靠预测科学构思能力的关键。

评估大语言模型的创造力:测试、局限与新前沿:论文配图
图 2:概述。像发散关联任务这样的人类创造力测试通常用于评估LLM的“创造力”。虽然这些人类测试的外部有效性得到了与构思任务的适度相关性的支持,但它们作为机器创造力衡量标准的有效性尚未得到充分证实。