论文
为什么 大语言模型 和人类在评估创造力方面有相同点和不同点
Why Large Language Models and Humans Converge and Diverge in Evaluating Creativity
摘要
尽管越来越多地使用 大语言模型 (LLM) 作为创造力评估器,但它们与人类评估一致的证据仍然好坏参半,这就提出了它们的判断何时以及为何与人类的判断一致或偏离的问题。通过三项研究和六项广泛使用的 LLM,我们通过确定 LLM 创造力评估的标准并检查其下游影响来解决这一差距。研究 1 表明,LLM 通常依赖于人类创造力评估标准的较小子集。在新颖性维度中与人类标准的趋同性最强,而在捕获社会、市场和声誉信息的上下文维度中分歧最明显。此外,每个 LLM 都展示了不同的、特定于模型的标准,这些标准在广度上存在很大差异。这些评价标准的差异体现在实际的创意判断上。研究 2(N = 1,103 个想法)表明,LLM 评估与人类评估具有中等相关性,并且具有更广泛标准的个体 LLM 可以更好地区分人类认为更具创造力和缺乏创造力的想法。研究 3(N = 1,195 名参与者)表明,LLM 对上下文信息不太敏感:此类信息显着改变了人类创造力评级,但使 LLM 评级基本保持不变。总之,我们的研究结果有助于解释 LLM 与人类一致性的混合证据,表明一致性取决于判断所需的证据以及每个模型应用的标准。因此,选择 LLM 评估器是一个必然的决定:不同的模型,应用不同的标准,将不同的想法视为创造性。