论文
跨开放式任务的语言模型的自动化创造力评估
Automated Creativity Evaluation of Language Models Across Open-Ended Tasks
摘要
大语言模型 (LLM) 在语言理解、推理和生成方面取得了显着的进步,引发了人们对其创造潜力的日益浓厚的兴趣。实现这一潜力需要系统且可扩展的方法来评估不同任务的创造力。然而,大多数现有的创造力指标与特定任务紧密耦合,将领域假设嵌入到评估过程中,并限制了可扩展性和通用性。为了解决这一差距,我们引入了一个自动化的、与领域无关的框架,用于量化开放式任务中的 LLM 创造力。我们的方法将测量设备与创意任务本身分开,从而实现可扩展的、与任务无关的评估。发散创造力是使用语义熵来衡量的,语义熵是一种无参考且稳健的新颖性和多样性指标,并根据人类注释、基于 LLM 的新颖性判断和基线多样性测量进行验证。聚合创造力通过一种新颖的基于检索的多智能体判断框架进行评估,该框架可以对任务完成情况进行上下文敏感的评估,效率提高了 60% 以上。我们使用广泛的 LLM 套件在三个性质不同的领域验证我们的框架:问题解决 (MacGyver)、研究构思 (HypoGen) 和创意写作 (BookMIA)。实证结果表明,我们的框架可靠地捕捉了创造力的关键方面,包括新颖性、多样性和任务完成度,并揭示了模型属性(例如大小、温度、新近度和推理)如何影响创意表现。我们的工作为自动化 LLM 创造力评估建立了可重复和通用的标准,为可扩展的基准测试和加速创意 AI 的进步铺平了道路。