论文
LLM 是否也变得具有同样的创造力?三年模型的证据
Are LLMs becoming similarly creative? Evidence from three years of models
摘要
许多基准测试都会跟踪 大语言模型 (LLM) 在具有可验证答案的任务上的性能,但人们对 LLM 在开放式任务中的性能如何演变知之甚少,在开放式任务中,创造力、原创性和多样性可能与质量一样重要。随着 LLM 越来越多地支持人类的构思和创造性工作,了解 LLM 在开放式任务上的性能趋势至关重要。本文对 LLM 模型发布三年内的创意输出进行了初步分析,检查了模型对 Infinity-Chat100(开放式用户查询的现实集合)和替代用途任务(一项已建立的心理测量创造力评估)的响应。使用句子嵌入相似性,我们检查 LLM 对这些提示的响应趋势。我们的研究结果显示,随着时间的推移,模型输出多样性在统计上显着下降,这表明 LLM 输出可能在跨模型的创造性实质上趋同。如果这种趋势持续下去,LLM 驱动的同质化可能会逐渐削弱人类在人类与人工智能共同创造工作中的能动性,从而需要仔细考虑 LLM 在人类创造过程中的作用。