论文

IDEAFix:LLM 中创意固定提示的评估框架

IDEAFix: Evaluation Framework for Creative Defixation Prompting in LLMs

模型评测基准与评测资源

摘要

大语言模型 (LLM) 越来越多地用于涉及创造性问题解决和创意生成的任务。然而,人们对它们的创造力缺乏共识:一些研究报告称它们的表现优于人类,而另一些研究则强调了结构性限制,例如固定和产出的同质化。现有的评估方法要么依赖于狭隘的、脱离情境的任务,无法捕获以目标为导向的生成,要么依赖于更广泛的设置,混淆了创作过程的多个方面,使得很难隔离任务制定、提示和评估设计的影响。值得注意的是,结构化提示策略在塑造创意产生方面的作用仍未得到充分探索。因此,我们引入了 IDEAFix,一个用于分析开放式创意生成任务中发散思维的评估框架。我们提示模型生成多个原始解决方案,以控制短设计场景、任务属性和固定提示策略的变化。该设计可以系统地分析结构化指导如何影响 LLM 的创意生成。我们的结果表明,任务制定和属性选择都会显着影响模型的性能,并且简单的提示策略可以提高解决方案的原创性。然而,我们还观察到跨模型的持续输出同质化,证实了它们生成不同解决方案的能力的固有限制。总体而言,IDEAFix 提供了一个受控的、可扩展的框架,用于研究 LLM 创造力的机制。