论文
大语言模型 创造力自动评估的局限性
The Limits of Automatic Evaluation of Creativity in Large Language Models
摘要
大语言模型 (LLM) 生成文本的能力越来越强,这些文本挑战人类在需要创造力的领域中的表现,但评估 LLM 生成的内容中的创造力仍然是一个重大挑战。在这里,我们研究当前的自动评估方法是否能够可靠地捕捉人类对创造力的判断。我们从WritingPrompts数据集中收集了人类对人类和人工智能生成的短篇故事的11个创造力维度的评估,并将这些判断与自动客观指标和LLM-as-a-Judge评估进行比较。我们的实验揭示了自动评估和人工评估之间存在很大的偏差。特别是,基于 LLM 的评委表现出对人工智能生成的故事的系统偏好,始终偏爱其风格特征,而不是人类创作文本的不可预测性和其他品质。此外,相关性分析表明,广泛使用的自动指标在人类和人工智能生成的故事中与人类判断的一致性几乎为零,这表明它们无法捕捉创造力的重要维度。这些发现凸显了当前创造性文本自动评估方法的根本局限性,并强调了将创造力的多维性和主观性降低到计算指标的难度。